“L’IA potrebbe ucciderci tutti”: l’allarme dall’interno di Anthropic
La corsa verso l’intelligenza artificiale sempre più potente potrebbe essere molto più rischiosa di quanto emerga dal dibattito pubblico. A sostenerlo non è soltanto un osservatore esterno, ma un giovane ricercatore che ha lavorato direttamente per due delle aziende più importanti nello sviluppo dell’intelligenza artificiale: OpenAI e Anthropic.
Jacob Coxon, 27 anni, ha annunciato le proprie dimissioni da Anthropic dopo circa tre anni di attività nella ricerca sul pre-addestramento dei modelli. Prima di approdare ad Anthropic aveva lavorato anche per OpenAI, scelta che aveva motivato proprio con una maggiore attenzione di Anthropic ai problemi di sicurezza e allineamento dell’IA.
Ora, però, Coxon sostiene che entrambe le aziende stiano partecipando a una corsa verso una nuova generazione di sistemi di intelligenza artificiale senza avere ancora risolto il problema fondamentale: come mantenere sotto controllo un’intelligenza che potrebbe diventare capace di migliorare autonomamente le proprie capacità.
“Stanno giocando con le nostre vite”
In un messaggio pubblicato sui social, Coxon ha accusato OpenAI e Anthropic di comportarsi in modo irresponsabile, sostenendo che stiano correndo verso la cosiddetta superintelligenza auto-migliorante. Il passaggio più inquietante riguarda però la percezione del rischio all’interno dello stesso settore:
“Le persone che sviluppano l’intelligenza artificiale credono sinceramente che potrebbe ucciderci tutti entro la fine del decennio”.
Non si tratta, nelle parole di Coxon, di una previsione secondo cui l’IA attuale sarebbe già in grado di provocare una catastrofe. Il problema riguarda piuttosto una possibile futura fase dello sviluppo tecnologico, nella quale i sistemi potrebbero diventare sufficientemente autonomi e potenti da modificare e migliorare le proprie capacità.
È il concetto di recursive self-improvement, o miglioramento ricorsivo: un sistema costruisce una versione più potente di sé, che a sua volta diventa capace di migliorarlo ulteriormente, innescando un processo potenzialmente molto rapido.
Anthropic conosce il rischio, ma continua a correre
Secondo Coxon, esisterebbe però una differenza importante tra OpenAI e Anthropic. La prima, a suo giudizio, non avrebbe ancora interiorizzato pienamente la portata dei rischi. Anthropic, invece, sarebbe perfettamente consapevole del problema ma si troverebbe intrappolata nella competizione.
Il ragionamento sarebbe semplice quanto inquietante: se Anthropic rallentasse lo sviluppo per lavorare sulla sicurezza, un’altra azienda potrebbe andare avanti e arrivare per prima alla superintelligenza.
Il risultato sarebbe una sorta di corsa agli armamenti tecnologica nella quale nessuno vuole essere il primo a frenare. Coxon contesta proprio questa logica. A suo avviso, decidere di entrare nella “fase finale” della corsa verso sistemi superintelligenti sarebbe una scelta troppo importante per essere lasciata alle strategie interne di singole aziende private.
La conferma di un altro ricercatore Anthropic
A rendere la vicenda ancora più significativa è intervenuto Evan Hubinger, uno dei ricercatori di Anthropic che si occupano proprio di allineamento dell’intelligenza artificiale.
Hubinger ha sostanzialmente confermato l’esistenza all’interno dell’azienda di una seria preoccupazione per uno scenario nel quale l’IA potrebbe rappresentare un rischio esistenziale per l’umanità. Lo stesso ricercatore ha indicato personalmente una probabilità superiore al 10% che l’IA possa arrivare a uccidere tutta l’umanità entro il prossimo decennio.
Ma soprattutto ha evidenziato quello che forse è l’aspetto più importante dell’intera vicenda: Anthropic non avrebbe ancora un piano concreto per garantire l’allineamento e la sicurezza di una futura superintelligenza, né sarebbe chiaramente sulla strada per averlo.
È un’ammissione particolarmente rilevante perché Anthropic è nata anche con una forte attenzione proprio a questi problemi. La società presenta infatti la sicurezza e l’allineamento come elementi centrali della propria missione.
Il problema non è l’IA di oggi
È importante evitare una lettura semplicistica della vicenda. Coxon non sostiene che i sistemi di IA oggi disponibili siano sul punto di sterminare l’umanità. Il problema che pone riguarda una possibile evoluzione futura.
I modelli stanno diventando sempre più autonomi, capaci di utilizzare strumenti, scrivere e verificare codice, operare per periodi prolungati e svolgere compiti complessi con una supervisione umana ridotta.
Lo dimostra anche la recente evoluzione dei prodotti Anthropic. Il 1° settembre l’azienda ha presentato Claude Fable 5.1 e Claude Mythos 5.1, descrivendo Fable 5.1 come il proprio modello più avanzato per attività di programmazione e lavoro cognitivo. Anthropic sottolinea inoltre la capacità dei nuovi sistemi di affrontare attività lunghe e articolate, utilizzare strumenti e operare come agenti con un livello crescente di autonomia.
Parallelamente, Mythos 5.1 è stato sviluppato per applicazioni avanzate nella cybersecurity e nella ricerca biologica ed è per ora riservato a organizzazioni selezionate. Anthropic riconosce esplicitamente che capacità di questo livello possono essere utilizzate sia per scopi benefici sia per attività dannose e ha quindi introdotto ulteriori sistemi di salvaguardia.
È proprio questo aumento progressivo delle capacità a rendere centrale il problema dell’allineamento.
Che cosa significa “allineare” un’intelligenza artificiale?
Con allineamento si intende, in termini molto semplificati, la capacità di fare in modo che gli obiettivi e i comportamenti di un sistema di IA rimangano coerenti con le intenzioni e i valori umani. Con i sistemi attuali il problema è già complesso, ma esiste una differenza fondamentale: gli esseri umani mantengono ancora un controllo significativo sui modelli.
Una futura IA molto più capace e autonoma potrebbe invece prendere decisioni, modificare strategie, utilizzare risorse e interagire con altri sistemi a una velocità molto superiore a quella con cui gli esseri umani potrebbero comprenderne e verificarne il comportamento.
Il punto sollevato da Coxon è quindi soprattutto la distanza tra la velocità dello sviluppo delle capacità dell’IA e la velocità con cui riusciamo a sviluppare sistemi di sicurezza altrettanto efficaci.
Una questione troppo importante per essere lasciata alle aziende?
Da questa prospettiva, la vicenda Coxon apre una questione che va oltre Anthropic e OpenAI. Se lo sviluppo di una tecnologia può potenzialmente produrre conseguenze globali, è sufficiente affidarne la gestione alla competizione tra aziende private? Coxon sembra rispondere di no.
La sua proposta non è semplicemente quella di aumentare gli investimenti nella ricerca sulla sicurezza, ma di affrontare il problema attraverso coordinamento internazionale, intervento pubblico e regole comuni, arrivando eventualmente a rallentare lo sviluppo dei sistemi più avanzati quando le garanzie di sicurezza non siano adeguate.
È una questione che presenta una certa analogia con altre tecnologie ad alto impatto: quando le conseguenze di un errore possono superare enormemente i confini dell’azienda che lo commette, la sicurezza non può essere considerata soltanto un problema privato.
Tra allarmismo e sottovalutazione
Naturalmente, una probabilità del 10% di estinzione dell’umanità non è una previsione scientifica nel senso tradizionale del termine. Si tratta di una valutazione soggettiva di un ricercatore su uno scenario futuro profondamente incerto. Ma sarebbe altrettanto semplicistico liquidarla come una fantasia catastrofista.
La vera notizia è un’altra: alcuni dei ricercatori che stanno costruendo questi sistemi ritengono concretamente possibile uno scenario estremo e, allo stesso tempo, ammettono di non sapere ancora come garantire la sicurezza di una futura superintelligenza.
È questo il punto che merita una discussione pubblica. La questione non è decidere oggi se l’IA salverà o distruggerà l’umanità. È stabilire quanto siamo disposti a correre quando non conosciamo ancora con sufficiente certezza dove stiamo andando.
E soprattutto chi debba decidere quale sia il limite oltre il quale la velocità dell’innovazione non può più essere considerata una giustificazione sufficiente.
La corsa alla superintelligenza, se davvero è iniziata, potrebbe quindi avere bisogno non soltanto di ingegneri sempre più bravi, ma anche di qualcosa che oggi sembra mancare: regole, coordinamento e una governance capace di mettere la sicurezza davanti alla competizione.
leggi anche Opportunità e rischi dell’intelligenza artificiale – Ecquologia²


