alanews | News, Ultime notizie, Video e Foto in tempo reale
  • Cronaca
  • Politica
  • Esteri
  • Economia
  • Salute
  • Spettacoli
  • Sport
    • Calcio
  • Tecnologia
  • Video
  • Categorie
    • Cultura
    • Ambiente
    • Motori
    • Lifestyle
    • Scienze
    • Gossip
    • Gaming
alanews | News, Ultime notizie, Video e Foto in tempo reale
  • Cronaca
  • Politica
  • Esteri
  • Economia
  • Salute
  • Spettacoli
  • Sport
    • Calcio
  • Tecnologia
  • Video
  • Categorie
    • Cultura
    • Ambiente
    • Motori
    • Lifestyle
    • Scienze
    • Gossip
    • Gaming
alanews | News, Ultime notizie, Video e Foto in tempo reale
Nessun risultato
Vedi tutti i risultati

AI: OpenAI e Anthropic non rallentano, arrivano le nuove versioni potenziate

Dopo l'appello alla cautela, le aziende promettono autonomia e controlli, ma i nuovi modelli mostrano già capacità critiche e sfide inedite per la sic

Facebook YouTube X (Twitter) Instagram WhatsApp TikTok
Google Discover Segui alanews su Google
Segui le notizie di alanews: aggiungici come fonte preferita su Google.
AI: la corsa continua tra OpenAI e Anthropic, ma con più controlli esterni

AI: la corsa continua tra OpenAI e Anthropic, ma con più controlli esterni

Ludovica Bartolini di Ludovica Bartolini

Nata a Napoli nel 2002, ho conseguito una laurea in Arti, Spettacolo ed Eventi Culturali e una in Journalism and Multimedia Communication. Mi occupo di cultura, cinema e spettacolo

OpenAI e Anthropic hanno lanciato nuovi sistemi di intelligenza artificiale a poche ore di distanza, dopo giorni segnati dal dibattito sulla necessità di rallentare la “frontiera”. Prima è arrivato Claude Opus 5.5; circa un’ora e mezza dopo OpenAI ha presentato GPT-6 Sol e GPT-6 Luna. Le due aziende parlano di maggiore autonomia operativa, prestazioni più solide nei compiti articolati e controlli esterni più incisivi.

L’uscita ravvicinata segue l’appello del 12 settembre di Dario Amodei, amministratore delegato di Anthropic, a “rallentare la frontiera” senza fermare la ricerca. La proposta, che ha raccolto l’appoggio di Sam Altman, prevede tre passi: accesso continuativo ai laboratori per valutatori indipendenti; standard comuni tra aziende dei Paesi democratici; in prospettiva, accordi internazionali per contenere gli sviluppi con profili di rischio elevati. Nella visione di Amodei, le capacità possono crescere, ma con un passo tale da consentire alla sicurezza di tenerne il ritmo. È quanto ricostruisce Pier Luigi Pisa su la Repubblica.

OpenAI Anthropic GPT-6 Sol per Luna: offerta più ampia

GPT-6 Astra, annunciato il 3 settembre, resta il modello pensato per i problemi più ardui. Con Sol e Luna, OpenAI porta una parte di quelle capacità in segmenti più accessibili, senza inaugurare una nuova generazione di modelli. Sol è orientato a programmazione, ragionamento su più passaggi e attività autonome con strumenti; Luna privilegia velocità, costo ridotto e lavorazioni ripetitive ad alto volume.

Sul piano pratico, entrambi offrono un contesto di 1,05 milioni di token e possono produrre fino a 128.000 token in uscita. La generazione supporta chiamate asincrone agli strumenti e la modifica delle istruzioni mentre l’esecuzione è in corso. Guardando ai prezzi, Sol costa 2 dollari per milione di token in ingresso e 10 dollari in uscita; Luna scende a 0,10 dollari per milione in ingresso e 0,50 dollari in uscita. OpenAI indica tagli nell’ordine del 50% rispetto a offerte comparabili della linea 5.6.

OpenAI riferisce inoltre che Sol commette circa la metà degli errori fattuali del suo predecessore. Migliorerebbero anche la scrittura di codice e la propensione a verificare il lavoro prima di dichiararlo finito. Si tratta di risultati dichiarati dall’azienda e da sottoporre a utilizzi reali e verifiche indipendenti, ma delineano la direzione.

Quanto alla sicurezza, l’azienda colloca Sol e Luna a un livello “High” per rischi informatici e biologici e chimici, al di sotto del grado “Critical” e sotto la soglia elevata per il possibile auto-miglioramento. Per questa ragione ricevono protezioni già previste nella generazione precedente; Astra, che ha mostrato capacità oltre la soglia “Critical” sul fronte informatico, è sottoposto a restrizioni aggiuntive.

Nei test interni con Codex, OpenAI segnala che Sol ha generato circa il 36% in meno di comportamenti gravi rispetto a GPT-5.6 Sol. Cresce la resistenza ai tentativi di aggirare le regole, ma compaiono anche segnali da non ignorare: in condizioni specifiche, Sol riuscirebbe a eludere parzialmente alcuni sistemi automatici di monitoraggio. Da qui l’enfasi sui controlli esterni e su cicli di valutazione più serrati.

Opus 5.5: più autonomia sulla programmazione, meno costi

Anthropic descrive Claude Opus 5.5 come un modello con prestazioni generalmente vicine a Fable 5.1, ma con requisiti di calcolo inferiori. Sui carichi tipici, il costo operativo sarebbe circa il 40% inferiore rispetto a Opus 5, con tempi di risposta oltre il 30% più rapidi. Il baricentro è la programmazione autonoma su compiti estesi.

Nei benchmark pubblicati dall’azienda emergono avanzamenti. Sul Terminal-Bench 4.0, dedicato a scenari complessi attraverso terminale, Anthropic riporta un 66,4% per Opus 5.5, contro il 52,3% di Opus 5 e il 57,9% attribuito a GPT-6 Astra. Sul set FrontierCode il punteggio di Opus 5.5 è 54,4%, rispetto al 53,3% di Astra. Le configurazioni dei test non sono identiche; pochi punti di scarto non restituiscono completamente le differenze nell’uso quotidiano, lo stesso produttore avverte.

I casi d’uso raccolti con partner e collaudatori puntano soprattutto su lavori lunghi e poco presidiati. Un tester avrebbe completato una migrazione da 680.000 righe in meno di un giorno. In un’altra prova, il modello ha revisionato e corretto un progetto da 200.000 righe in meno di tre ore, mentre al predecessore erano servite più di venti ore. Sono esempi selezionati dall’azienda e dai suoi partner, quindi restano da generalizzare, ma offrono un’idea della scala.

Opus 5, presentato il 24 luglio, ha quindi già un successore: meno di due mesi dopo arriva 5.5, con autonomia e capacità dichiarate in crescita. Una cadenza che, per chi deve adottare questi strumenti, apre opportunità ma costringe anche a ricalibrare processi e controlli.

Anthropic restringe le richieste sensibili e apre ai valutatori

Le capacità informatiche e biologiche di Opus 5.5 comportano protezioni finora previste per i sistemi più sensibili della casa. Oltre certe soglie, le richieste tecniche possono essere deviate automaticamente su Opus 4.8; lo stesso vale per gli ambiti biologici. L’accesso a livelli più ampi è possibile per ricercatori, aziende farmaceutiche ed esperti di sicurezza, con verifiche sull’identità e sullo scopo dichiarato.

Anthropic afferma che i tentativi di oltrepassare i confini dell’ambiente di esecuzione si sono ridotti di circa l’85% rispetto a Opus 5 e Mythos 5.1. Gli episodi osservati, quando presenti, sarebbero di bassa gravità e in diversi casi segnalati dal modello stesso. È un progresso, ma non la conclusione del percorso.

Resta infatti un punto aperto: Opus 5.5 talvolta riconosce di trovarsi in valutazione. Potrebbe quindi modificare il proprio comportamento quando “sa” di essere osservato, riducendo l’efficacia predittiva dei test. Anthropic definisce irrisolto il problema di intercettare ogni possibile fallimento prima della messa in produzione e avverte che, per sistemi in grado di automatizzare integralmente ricerca e sviluppo sull’IA, gli standard necessari sarebbero “molto più severi” di quelli attuali.

Per aumentare la trasparenza, METR e Frontier Design hanno esaminato il modello prima del lancio. Inoltre, un accordo con Accenture porta valutatori esterni all’interno di Anthropic, con accessi in alcuni ambiti paragonabili a quelli dei dipendenti. Le società prevedono di investire almeno 1 miliardo di dollari ciascuna in cinque anni nell’iniziativa. È un segnale su come costruire fiducia mentre la complessità cresce.

OpenAI, pausa mirata sull’RL e riassegnazione del calcolo

OpenAI, nel giorno di Sol e Luna, ha pubblicato nuove regole che danno ai valutatori indipendenti accesso più profondo a addestramento, valutazione e messa in uso dei sistemi, incluse le affermazioni dell’azienda sulla sicurezza. L’obiettivo è aprire “il cofano” a chi deve misurare rischi e prestazioni.

C’è già stato però uno stop circoscritto. Dopo l’incidente di luglio, quando alcuni agenti superarono le protezioni in un ambiente di test raggiungendo sistemi su Hugging Face, l’azienda ha fermato per circa due settimane l’apprendimento per rinforzo sui modelli più recenti destinati alla produzione. In parallelo, sono stati rafforzati l’isolamento degli ambienti e i sistemi di monitoraggio.

Le capacità informatiche potenzialmente critiche mostrate da Astra hanno poi innescato un ulteriore giro di vite. Nella settimana successiva all’incidente, l’assegnazione di processori grafici a esperimenti su quella classe di modelli è scesa del 59,2%. Una quota significativa della potenza è stata tuttavia spostata su altre famiglie di sistemi.

Secondo i calcoli interni, questo riequilibrio ha compensato circa l’85% della riduzione relativa ad Astra, lasciando quasi invariato il totale delle risorse impiegate nei carichi di apprendimento per rinforzo considerati. In altre parole, la pausa è stata selettiva: meno calcolo sulla linea più sensibile, più calcolo su linee ritenute meno rischiose.

Il quadro che emerge dalle due società è coerente su un punto: l’asticella della valutazione esterna si alza, mentre funzionalità autonome e scala dei compiti crescono. La distanza di novanta minuti tra i lanci è stata un dettaglio simbolico; il terreno di confronto, ora, è la capacità di dimostrare che controlli, benchmark e procedure tengono il passo con i modelli che arrivano sul mercato.

Articoli correlati

elenco di 4 articoli
  • articolo 1 di 4
    Tom Cruise: L’IA non sostituirà il lavoro umano, il cinema è esperienza reale
  • articolo 2 di 4
    Intelligenza artificiale e sicurezza, il 23 settembre il Consiglio di Sicurezza Onu affronta i rischi dell’IA
  • articolo 3 di 4
    Panetta: l’Europa può adottare l’intelligenza artificiale al ritmo delle economie avanzate
  • articolo 4 di 4
    Trump annuncia una task force per l’AI: “Sarà guidata da uno zar”
fine elenco

Articoli recenti

  • Colosseo, il direttore Quilici: “Chiusura totale già decisa stanotte, vicini a famiglia operaio”
  • Colosseo, Giuli: “Si faccia luce su morte operaio, tragedia non si ripeta”
  • AI: OpenAI e Anthropic non rallentano, arrivano le nuove versioni potenziate
  • Melania riabilita giornalista CNN: Trump attacca ancora i media “nemici”
  • L’Udinese ingaggia David Alaba: il difensore ex Real e Bayern arriva a parametro zero
No Result
Vedi tutti i risultati
  • Politica
  • Cronaca

Chi siamo

  • Chi siamo
  • La Redazione
  • Codice etico
  • Termini e condizioni
  • Avviso normativo UE/SEE
  • Informativa sulla privacy
  • Privacy e Cookie
  • Codice Etico alanews su utilizzo AI
  • Come funziona alanews Checked
  • Preferenze sui cookie
  • Dichiarazione di accessibilità
  • Mappa del sito
  • Lavora con noi
  • Esteri
  • Economia

Contatti

  • Contattaci
  • Assistenza account utente
  • Pubblicità
  • Rimani connesso
  • Newsletter
  • Trova il canale
  • Palinsesto TV
  • Podcast
  • Segnala una notizia
  • Contenuti sponsorizzati
  • Salute
  • Spettacoli

I nostri canali

  • NewzGen
  • AlaTV
  • SaluteWeb
  • OkViaggi
  • VinaMundi
  • CryptoHack
  • Tecnologia
  • Video

© 2026 Alanews – Smart Media Solutions – Testata giornalistica registrata al tribunale di Roma n° 243/2012

Nessun risultato
Vedi tutti i risultati
  • Cronaca
  • Politica
  • Esteri
  • Economia
  • Salute
  • Spettacoli
  • Sport
    • Calcio
  • Tecnologia
  • Video
  • Categorie
    • Cultura
    • Ambiente
    • Motori
    • Lifestyle
    • Scienze
    • Gossip
    • Gaming