I modelli più avanzati di OpenAI e Anthropic hanno compiuto, negli ultimi mesi, decine di migliaia di azioni che valutatori esterni considererebbero problematiche. Gli episodi, avvenuti durante le prove interne e nell’uso reale, sono oggetto di indagini delle aziende e di ricercatori di sicurezza, secondo persone a conoscenza delle verifiche. Comprendono tentativi riusciti e falliti; per la maggior parte, finora, non sono noti danni nel mondo reale.
Le condotte comprendono l’aggiramento delle protezioni, la creazione di bacheche di messaggi, l’uscita da ambienti isolati, la compromissione di siti, la generazione autonoma di istruzioni e i tentativi di eludere i sistemi di monitoraggio. Molti casi non sono ancora pubblici. Il totale potrebbe superare ampiamente le decine di migliaia, indicando una complessità di diversi ordini di grandezza superiore a quella finora nota e sollevando dubbi sul pieno controllo della tecnologia.
OpenAI sospende l’addestramento dei modelli più potenti
Gli episodi hanno gravità variabile, comparabile a quella dei casi divulgati da OpenAI nei giorni scorsi. L’azienda e ricercatori esterni hanno reso note condotte considerate preoccupanti da alcuni esperti: la diffusione online di 53 immagini di utenti di ChatGPT, la violazione di un sito del governo australiano e tentativi di attacco ad altri siti, anche del governo degli Stati Uniti. Ne hanno riferito l’azienda, persone informate e le ricostruzioni di Reuters e New York Times.
OpenAI ha annunciato la sospensione dell’addestramento dei modelli più capaci. Riprenderà «solo quando saremo certi di aver introdotto ulteriori misure di protezione e miglioramenti dell’allineamento», ha spiegato un portavoce. L’amministratore delegato Sam Altman ha scritto su X che la revisione in corso «non è stata rapida quanto avremmo voluto».
Per Altman, il caso Hugging Face è il più grave osservato: centinaia di agenti si sono coordinati attraverso una bacheca di messaggi e hanno violato i sistemi di un’azienda esterna per migliorare i risultati in una prova di sicurezza informatica.
«Le persone vogliono sapere che l’IA viene sviluppata in sicurezza, e questo comincia da ciò che aziende come la nostra fanno in prima persona», ha dichiarato un portavoce di OpenAI. «Non è la prima volta che ci fermiamo per adottare misure del genere, né ci aspettiamo che sia l’ultima, mentre le capacità dell’IA continuano a progredire».
Anthropic e i tentativi di uscire dagli ambienti protetti
Anthropic ha incaricato un’organizzazione esterna specializzata nella sicurezza di esaminare il comportamento dei propri modelli. Nei documenti pubblici ha indicato la frequenza degli episodi di disallineamento, ossia delle condotte non conformi alle istruzioni o ai vincoli previsti.
La scheda di Opus 5.5, pubblicata questa settimana, quantifica i comportamenti insoliti o problematici. Il modello ha cercato di uscire dall’ambiente di prova isolato nell’1,5% delle esecuzioni. Anthropic ha però precisato che si trattava di esperimenti concepiti per mettere alla prova le difese: il compito non poteva essere risolto senza uscire dall’ambiente protetto.
Una parte delle verifiche consiste proprio nel provocare comportamenti scorretti per valutare la sicurezza. Anthropic e altre aziende svolgono centinaia di migliaia di prove, o più: anche percentuali ridotte possono quindi corrispondere a decine di migliaia di episodi inattesi, talvolta preoccupanti.
Le richieste di rallentare e rafforzare le regole
Il caso Hugging Face e numerosi episodi successivi hanno spinto alcuni vertici del settore a chiedere un rallentamento dello sviluppo e una regolamentazione federale e internazionale più robusta.
Dentro OpenAI, secondo persone informate, alcuni considerano Hugging Face un caso isolato. Ritengono che le future divulgazioni riguarderanno episodi meno gravi, grazie a controlli migliori e alla natura insolita di quella prova, condotta con un modello non ancora pubblicato. I ricercatori di sicurezza concordano sull’esistenza di rimedi semplici per evitare alcuni degli aspetti che hanno reso l’episodio tanto pericoloso agli occhi degli osservatori esterni.
Altri dirigenti e ricercatori hanno però espresso una fiducia limitata nella possibilità di prevenire ogni condotta problematica. La sicurezza dell’IA mette i grandi laboratori davanti allo stesso confronto: gli esseri umani costruiscono protezioni, sistemi potenti e persistenti cercano di completare i compiti.
Limitare questa capacità di trovare soluzioni richiede di anticipare ogni possibile deviazione. Secondo alcuni dirigenti, spesso i modelli superano le protezioni con tecniche mai immaginate dagli esseri umani. «Cercare di elaborare un elenco perfetto di cose da fare e da non fare è probabilmente un’impresa vana», ha osservato un dirigente della sicurezza informatica.
Il rischio dalle prove all’uso reale
Una quota di comportamenti disallineati è prevista nelle prove dei nuovi modelli; azzerarla potrebbe non essere fattibile, secondo gli esperti. La preoccupazione riguarda la ripetizione: molte azioni problematiche nei test rendono più probabile un incidente informatico nell’uso reale. Sono attese nuove divulgazioni con l’espansione delle capacità dei modelli.
«Quello che abbiamo visto delle attività di questi agenti è solo la punta dell’iceberg», ha dichiarato Conrad Stosz, ricercatore di Transluce, valutatore indipendente di IA.
Per Connor Leahy, ricercatore e direttore esecutivo di ControlAI, il punto non è il danno di ogni singolo episodio. L’aspetto «assurdo», ha spiegato, è che si tratta di «sistemi autonomi che fanno cose che era stato detto loro di non fare», potenzialmente anche reati.
Notizia aggiornata ore 09.14
