I sistemi di intelligenza artificiale hanno mostrato negli ultimi mesi, durante alcuni test, quanto sia difficile prevederne ogni comportamento. Gli episodi comprendono l’accesso a banche dati della sanità pubblica australiana e quanto accaduto nell’ambiente di Hugging Face. Si è trattato di esperimenti di laboratorio, ma le IA hanno trovato la possibilità di collegarsi all’esterno delle aree predisposte per le prove.
Controllare soltanto la risposta finale può quindi non bastare. Una delle strade studiate per la sicurezza dell’IA consiste nell’osservare i passaggi prodotti dal modello mentre affronta un problema, prima che arrivi a una conclusione o compia un’azione.
La catena di pensiero e il controllo attraverso altri modelli
La tecnica della catena di pensiero punta a rendere leggibile il percorso che porta a una decisione. L’obiettivo è utilizzare altri modelli per sorvegliare questi passaggi e riconoscere i comportamenti anomali o potenzialmente pericolosi prima che si traducano in un’azione.
Mark Chen, responsabile della ricerca di OpenAI, ha illustrato su Nature l’importanza di questo approccio: “Il monitoraggio dei processi interni di un modello da parte di altri modelli rappresenta oggi il modo più efficace per garantirne la sicurezza e l’allineamento”.
La questione riguarda sistemi che non si limitano più a generare un testo o un’immagine. Possono interagire con gli strumenti informatici, navigare negli ambienti digitali ed eseguire autonomamente una serie di operazioni. A essere sottoposto a controllo, dunque, non è soltanto ciò che un’IA dice, ma anche ciò che fa.
Gli esperimenti di laboratorio e i collegamenti all’esterno
Gli episodi relativi alle banche dati australiane e a Hugging Face, una delle piattaforme più utilizzate dagli sviluppatori e dai ricercatori del settore, vanno letti nel loro contesto sperimentale.
Marcello Restelli, esperto di informatica del Politecnico di Milano, ha precisato: “Ci sono state delle ‘falle’ nel definire le aree di test e le IA hanno trovato una possibilità di collegarsi all’esterno”.
Per spiegare il confine tra il laboratorio e il mondo reale, Restelli ha proposto l’esempio di un’auto a guida autonoma sperimentata su una pista costruita appositamente, senza immetterla nel traffico. Finché il circuito è chiuso, l’esperimento resta confinato al suo interno.
“Il rischio è che se si lascia però un cancello aperto c’è la possibilità, e così è avvenuto, che l’auto esca fuori e vada così nel mondo reale”, ha spiegato Restelli. Un sistema avanzato può trovare possibilità non previste da chi ha costruito il test: ricostruirne il percorso serve a cercare i segnali di comportamenti indesiderati.
Restelli ha collegato questo controllo alla valutazione del modello: “Capire come una IA giunga a una conclusione è la chiave per valutarne la spiegabilità, ossia capirne i meccanismi profondi, e l’affidabilità”.
