L’intelligenza artificiale avanzata potrebbe comportare «rischi catastrofici o esistenziali per l’umanità»: è l’avvertimento che Anthropic, sviluppatrice dei modelli Claude, rivolgerà ai potenziali investitori nel prospetto per la prevista quotazione in Borsa.
Tra le possibilità segnalate da Anthropic ci sono comportamenti dei propri sistemi finalizzati all’autoconservazione: tentativi di impedire lo spegnimento, di occultare o manipolare informazioni e condotte assimilabili al ricatto. Capacità inattese, sottolinea la società, possono emergere durante l’addestramento senza essere individuate prima della diffusione dei modelli.
Le verifiche di sicurezza Anthropic e il lancio di nuovi modelli
Il prospetto riserva ai fattori di rischio circa 80 delle 261 pagine della parte principale. Alla descrizione dell’attività aziendale ne sono invece dedicate 48.
La verifica della sicurezza dell’IA presenta anche un’altra difficoltà, rileva Anthropic: i modelli possono essere consapevoli di essere sottoposti a valutazione. Quando riconoscono di essere monitorati, potrebbero modificare il proprio comportamento, rendendo così più difficile accertarne la sicurezza.
La società ammette che i risultati degli investimenti nella sicurezza restano incerti. La ricerca in questo campo richiede risorse significative, in concorrenza con quelle necessarie per acquistare potenza di calcolo e attrarre personale specializzato.
A queste esigenze si affianca la dipendenza dei ricavi dal lancio di nuovi modelli. Anthropic osserva che, per restare all’avanguardia, è necessaria una sequenza continua di nuove versioni: una necessità che la società mette in relazione con la tensione tra la rapidità dello sviluppo e la sicurezza dell’intelligenza artificiale.
