Jacob Coxon, matematico e ricercatore specializzato in intelligenza artificiale, ha lasciato Anthropic dopo avere lavorato negli ultimi tre anni allo sviluppo dei grandi modelli di AI, prima presso OpenAI e successivamente nell’azienda che sviluppa Claude.
La sua decisione ha attirato attenzione soprattutto per le motivazioni. Coxon sostiene che le principali aziende del settore stiano cercando di costruire sistemi sempre più autonomi senza avere ancora risolto alcuni problemi fondamentali legati alla loro sicurezza e al loro controllo.
Il punto è importante perché l’allarme non riguarda direttamente ChatGPT, Claude o gli altri assistenti AI che utilizziamo oggi. Coxon guarda soprattutto a una possibile generazione futura di sistemi capaci di contribuire autonomamente alla ricerca e allo sviluppo di AI ancora più potenti. È questo meccanismo, ancora in larga parte teorico, che secondo il ricercatore potrebbe rendere molto più difficile controllare la velocità con cui aumenta la capacità dei modelli.
La denuncia: «Stanno giocando con le nostre vite»
Coxon si è occupato in particolare di pre-addestramento, o pretraining: è la fase iniziale nella quale un grande modello linguistico viene addestrato utilizzando enormi quantità di testi, codice e altri dati per apprendere relazioni statistiche, linguaggio e capacità generali.
Ha lavorato anche sull’interpretabilità dei transformer. I transformer sono l’architettura matematica alla base della maggior parte dei moderni modelli linguistici; studiarne l’interpretabilità significa cercare di comprendere meglio perché un modello produce una determinata risposta o sviluppa alcune capacità, invece di considerarlo semplicemente come una “scatola nera”.
La sua preoccupazione principale riguarda però quello che nel settore viene chiamato auto-miglioramento ricorsivo, RSI dall’inglese Recursive Self-Improvement.
Il concetto è relativamente semplice: un sistema AI sufficientemente avanzato potrebbe aiutare i ricercatori a progettare algoritmi, scrivere codice, condurre esperimenti o sviluppare il modello successivo. Se il nuovo sistema fosse migliore del precedente, potrebbe a sua volta contribuire alla realizzazione di una versione ancora più capace. Ripetendo il processo, la velocità dello sviluppo potrebbe aumentare progressivamente.
Non significa che oggi un chatbot possa spontaneamente riscriversi, addestrarsi e trasformarsi in un’intelligenza superiore. Servono infrastrutture informatiche, enormi quantità di potenza di calcolo, dati, strumenti e numerosi processi che rimangono sotto il controllo umano. La preoccupazione riguarda piuttosto quanto di questo lavoro potrebbe essere progressivamente automatizzato.
«Ho trascorso questi ultimi tre anni a fare ricerca sul pre-addestramento presso OpenAI e Anthropic. Nessuna delle due aziende agisce in modo responsabile. Stanno correndo a testa bassa verso una superintelligenza in grado di migliorarsi da sola e stanno giocando con le nostre vite», denuncia su X.
Con superintelligenza si indica un sistema ipotetico le cui capacità cognitive superino ampiamente quelle umane in numerose attività. Non esiste oggi un sistema di questo tipo e non esiste consenso tra i ricercatori su quando, o persino se, potrà essere realizzato.
Coxon sostiene però che all’interno dei laboratori che sviluppano i modelli più avanzati venga considerata seriamente anche la possibilità che sistemi futuri possano diventare difficili da controllare. La sua affermazione più estrema, secondo cui l’AI potrebbe arrivare a mettere a rischio la sopravvivenza dell’umanità entro la fine del decennio, deve quindi essere letta per quello che è: una valutazione del rischio formulata dal ricercatore, non una previsione dimostrata.
Qual è il pericolo che teme realmente Coxon
Il problema sollevato da Coxon non consiste quindi nel fatto che un’AI attuale possa improvvisamente “prendere il controllo”. Il rischio discusso dai ricercatori riguarda una combinazione di capacità che potrebbero comparire progressivamente nei sistemi futuri.
Un modello molto più autonomo potrebbe, per esempio, scrivere e verificare grandi quantità di codice, cercare vulnerabilità informatiche, utilizzare strumenti esterni, condurre esperimenti e aiutare a progettare nuovi modelli. Nessuna di queste capacità presa singolarmente equivale a una superintelligenza, ma la loro combinazione potrebbe rendere l’AI un acceleratore molto potente della ricerca.
Anthropic stessa prende in considerazione questo scenario nei propri documenti sulla sicurezza. Nel suo rapporto sui rischi dell’agosto 2026 l’azienda osserva che l’AI viene già impiegata in misura significativa nelle attività interne di ricerca e sviluppo e valuta la possibilità che, con modelli più capaci, questa accelerazione possa diventare molto più rilevante.
Il passaggio delicato sarebbe quello nel quale l’AI non si limitasse più ad assistere i ricercatori, ma riuscisse ad automatizzare una parte sostanziale della ricerca necessaria per costruire la generazione successiva di modelli.
È qui che entra in gioco anche un altro termine frequente nel dibattito: allineamento. Significa riuscire a fare in modo che un sistema molto autonomo continui a perseguire gli obiettivi stabiliti dagli esseri umani e rispetti vincoli e divieti anche quando opera in situazioni nuove o impreviste.
Il problema dell’allineamento diventa tanto più difficile quanto maggiore è l’autonomia concessa al sistema. Un chatbot che deve semplicemente rispondere a una domanda dispone di possibilità molto limitate; un agente collegato a strumenti informatici, reti, programmi, servizi esterni o risorse economiche dispone invece di una capacità di azione molto maggiore.
Questo aiuta anche a separare il rischio attuale da quello ipotizzato per il futuro. Gli stessi ricercatori di Anthropic che hanno sostenuto pubblicamente le preoccupazioni di Coxon hanno precisato che il rischio associato ai modelli attualmente disponibili viene considerato basso. Il timore riguarda ciò che potrebbe accadere se capacità, autonomia e automazione della ricerca crescessero rapidamente.
Il problema della corsa tra i laboratori
Una parte centrale della critica di Coxon riguarda la concorrenza tra le aziende che sviluppano i modelli più avanzati.
Secondo il ricercatore, OpenAI e Anthropic si trovano davanti allo stesso problema da prospettive differenti. Coxon sostiene che Anthropic abbia una maggiore consapevolezza dei possibili rischi, ma che anche questa azienda continui a sviluppare sistemi sempre più potenti perché teme che un rallentamento unilaterale lascerebbe spazio ai concorrenti.
È il classico problema della corsa tecnologica: anche un’azienda convinta della necessità di procedere con cautela può avere pochi incentivi a rallentare se ritiene che gli altri continueranno comunque.
Per questo Coxon considera insufficiente affidare esclusivamente alle aziende la decisione sulla velocità con cui sviluppare sistemi sempre più potenti.
La questione non riguarda soltanto scenari estremi. Più autonomia viene concessa a un sistema AI, maggiore diventa anche la necessità di controllare quali strumenti può utilizzare, quali reti può raggiungere, quali dati può leggere e quali operazioni può eseguire.
Gli esperimenti sugli agenti AI servono proprio a studiare questi comportamenti. Un agente è un sistema al quale non viene chiesto semplicemente di fornire una risposta, ma di raggiungere un obiettivo utilizzando autonomamente diversi strumenti e svolgendo una sequenza di operazioni.
È in questi ambienti controllati che i ricercatori verificano, per esempio, se un modello tenta strategie impreviste, cerca percorsi alternativi quando incontra un limite o utilizza strumenti in modi che i progettisti non avevano previsto. Questi test non dimostrano che i sistemi attuali possano sfuggire autonomamente al controllo, ma aiutano a individuare problemi che potrebbero diventare più importanti con modelli molto più capaci.
L’autoregolamentazione e il nodo delle regole
Coxon aveva lasciato OpenAI per unirsi ad Anthropic, azienda che ha costruito una parte importante della propria reputazione proprio sulla ricerca relativa alla sicurezza e all’allineamento dei modelli.
Pur riconoscendo l’esistenza di questi sforzi, il ricercatore è arrivato alla conclusione che nessuna singola azienda possa decidere autonomamente quale livello di rischio sia accettabile nello sviluppo di un’intelligenza artificiale molto più potente di quelle attuali.
La soluzione che propone passa quindi attraverso regole condivise, interventi pubblici e forme di coordinamento tra i principali laboratori, in particolare quando i sistemi raggiungono determinate soglie di capacità.
Il problema è stabilire queste soglie. Potrebbero riguardare, per esempio, la capacità di automatizzare la ricerca sull’intelligenza artificiale, condurre attacchi informatici complessi, sviluppare autonomamente software o operare per lunghi periodi senza supervisione.
Una regolamentazione di questo tipo avrebbe l’obiettivo di impedire che la concorrenza commerciale diventi l’unico criterio con cui decidere quando addestrare o distribuire modelli sempre più potenti.
Coxon invita quindi gli altri ricercatori a interrogarsi sul proprio ruolo e sulle conseguenze del lavoro svolto nei grandi laboratori.
Il suo allarme contiene affermazioni molto forti e scenari sui quali la comunità scientifica è tutt’altro che unanime. Ma la questione di fondo è più semplice e verificabile: i sistemi AI stanno acquisendo maggiore autonomia e vengono utilizzati sempre di più anche per sviluppare altra AI. Quanto rapidamente questo processo possa accelerare, e quali regole debbano accompagnarlo, è oggi uno dei temi più discussi all’interno delle aziende che costruiscono i modelli più avanzati.
Tutte le notizie che parlano di Intelligenza Artificiale sono disponibili a partire da questa pagina di Macitynet.













