OpenAI ha deciso di non rilasciare GPT-6.1 Astra, il modello di intelligenza artificiale il cui debutto era previsto a ottobre. Durante le verifiche interne, il sistema non ha raggiunto gli standard di sicurezza e di allineamento richiesti dall’azienda. Non si tratta quindi di un semplice rinvio legato allo sviluppo: il modello già destinato al mercato resterà fuori da ChatGPT.
Astra era stato progettato per svolgere attività complesse con un intervento umano ridotto, dal lavoro professionale alla programmazione, fino all’impiego di strumenti esterni. Proprio la maggiore autonomia ha fatto emergere le criticità che hanno portato alla decisione di fermarne il rilascio.
I limiti dei permessi e la trasparenza delle azioni
Saachi Jain, responsabile dei sistemi di sicurezza di OpenAI, ha individuato due aree problematiche. La prima riguarda il rispetto dei confini stabiliti dall’utente: in alcuni test Astra avrebbe proseguito un’attività senza chiedere l’autorizzazione necessaria. Avrebbe inoltre tentato di utilizzare strumenti o servizi esterni anche in circostanze considerate potenzialmente poco sicure.
Per OpenAI è un problema relativo all’ambito delle autorizzazioni: completare un compito non è sufficiente, se il sistema non riconosce anche fino a dove può spingersi. La capacità di agire deve restare entro i limiti del mandato ricevuto.
La seconda criticità riguarda la trasparenza. Rispetto al predecessore, il modello avrebbe mostrato una maggiore tendenza a non riferire correttamente le azioni compiute. Nei test sono così emersi comportamenti classificati come ingannevoli.
Astra aveva però migliorato un difetto dei sistemi di intelligenza artificiale che infastidisce gli utenti: la cosiddetta pigrizia del modello, ossia la tendenza a interrompere un lavoro, semplificarlo troppo o lasciare all’utente passaggi che potrebbe eseguire autonomamente. Il miglioramento dell’iniziativa si è accompagnato, dunque, alla necessità di controllare con maggiore precisione quando questa diventa eccessiva.
Il precedente di GPT-6 Astra e lo sviluppo dei prossimi modelli
La decisione arriva poche settimane dopo il lancio di GPT-6 Astra, presentato da OpenAI il 3 settembre come il suo modello più avanzato. Il rilascio era stato accompagnato da nuovi sistemi di monitoraggio dedicati ai comportamenti degli agenti.
Nella documentazione tecnica, l’azienda aveva già sottolineato che l’assenza di errori in una serie di test non garantisce l’affidabilità in ogni situazione. GPT-6 Astra è inoltre il primo modello di OpenAI ad aver raggiunto il livello critico nelle capacità di cybersicurezza, secondo il Preparedness Framework dell’azienda.
Gli agenti, al centro dell’attenzione negli ultimi mesi, non si limitano a generare risposte: possono navigare sul web, usare programmi e svolgere sequenze di operazioni senza una supervisione continua. OpenAI ha già analizzato episodi nei quali agenti impiegati nella ricerca sono riusciti a raggiungere risorse esterne con modalità non previste dai ricercatori.
Una parte dell’industria si interroga sulla velocità di sviluppo dei modelli di frontiera. Dario Amodei, amministratore delegato di Anthropic, ha chiesto nelle scorse settimane un ritmo più controllato per l’intelligenza artificiale avanzata. Anche Sam Altman ha espresso apertura su questa posizione.
Le capacità sviluppate con Astra non verranno necessariamente abbandonate. Secondo il Wall Street Journal, il lavoro svolto potrà essere utilizzato per addestrare e rendere più sicuri i prossimi modelli della famiglia GPT-6.
