AI · · 4 min read
GPT-6 Astra stabilisce un nuovo record nel benchmark ARC-AGI-3
GPT-6 Astra di OpenAI è nettamente in testa nell’ARC-AGI-3, anche se i suoi risultati variano sensibilmente a seconda di come la valutazione conserva lo stato del ragionamento.
GPT-6 Astra di OpenAI ha stabilito un nuovo record nel benchmark di ragionamento ARC-AGI-3, ottenendo il 62.7% nel sistema di test neutrale utilizzato da ARC Prize. Secondo quanto riportato da Startup Fortune, il risultato è più del doppio del precedente punteggio di frontiera verificato.
Il risultato è arrivato a un costo considerevole. Una valutazione completa con il livello di ragionamento più elevato di Astra è costata circa $26,000, sulla base della stima fornita insieme ai risultati del test. Il punteggio colloca Astra nettamente davanti a Claude Opus 5, che a luglio aveva raggiunto il 30.2%, e al precedente modello di punta di OpenAI, GPT-5.6 Sol, che aveva registrato il 7.8%.
Il risultato è inoltre più significativo perché è stato ottenuto con l’harness Standard, progettato per applicare le stesse condizioni di base ai modelli di aziende diverse. Questo fa del punteggio del 62.7% di Astra il dato più utile per confrontarlo con i concorrenti, anche se OpenAI ha ottenuto un risultato molto più alto con il proprio sistema di test.
Due test, due risultati molto diversi
Quando Astra è stato valutato tramite l’harness Provider Adapter di OpenAI, il suo miglior risultato osservato è salito al 99.9%. Quella prova ha utilizzato il modello con un livello di ragionamento elevato ed è costata circa $18,800. Non si è trattato di una nuova versione di Astra, ma di un cambiamento nel modo in cui il ragionamento interno del modello veniva trasferito da un passaggio a quello successivo.
ARC-AGI-3 sottopone i modelli a enigmi interattivi che richiedono loro di comprendere ambienti sconosciuti e di agire al loro interno. Nell’harness Standard, un modello può conservare gli appunti che crea deliberatamente, ma il suo stato di ragionamento privato non viene mantenuto tra una richiesta e l’altra. Tutti i modelli presenti nella classifica pubblica sono soggetti a questa limitazione.
L’adapter di OpenAI consente ad Astra di conservare lo stato di ragionamento opaco per tutta la durata di un enigma e di comprimere quello stato quando necessario. Questa continuità aggiuntiva ha prodotto la differenza di 37.2 punti tra i due risultati. ARC Prize ha evidenziato la distinzione nella propria analisi, il che significa che il dato del 99.9% non dovrebbe essere considerato direttamente equivalente al punteggio della classifica neutrale.
Per i confronti tra aziende, il risultato Standard resta quindi il benchmark più difendibile. Anche secondo questi criteri più rigorosi, il vantaggio di Astra è considerevole. Anthropic non ha pubblicato un risultato verificato di Claude Opus 5.5 nell’ARC-AGI-3. Grok 4.6 ha ottenuto il 2.11% in una prova XHigh, mentre i precedenti risultati di Grok 4.5 avevano raggiunto lo 0.3%; al momento preso in esame dal report, nella classifica non compariva alcun risultato verificato di Grok 4.7.
Prove di una risoluzione dei problemi più efficiente
L’analisi di ARC Prize è andata oltre la percentuale del punteggio. Nel 96% dei livelli testati, Astra ha utilizzato meno azioni rispetto al partecipante umano mediano. In questi compiti, ha compiuto in media il 51.7% di mosse in meno prima di arrivare a una soluzione.
Il modello sembrava inoltre costruire descrizioni simboliche compatte di mondi di gioco sconosciuti e riutilizzarle nella pianificazione delle azioni successive. Questo approccio differisce dal sondare ripetutamente un ambiente senza conservare un modello operativo coerente. Somiglia più da vicino all’apprendimento delle regole di un nuovo gioco e all’applicazione di tale comprensione mentre la partita prosegue.
Questi risultati non stabiliscono esattamente come sia costruito Astra. OpenAI non ha fornito una descrizione dettagliata dell’architettura del modello. Aidan Clark, vicepresidente della ricerca dell’azienda, ha dichiarato che Astra è stato il primo modello di OpenAI addestrato in una sessione che ha coinvolto più di 100,000 GPU presso il sito Stargate dell’azienda in Texas. Ha inoltre affermato che si è trattato del primo ciclo di addestramento nel quale modelli precedenti di OpenAI hanno contribuito a supervisionare lo sviluppo del loro successore.
Il ricercatore di AI Sebastian Raschka ha discusso le indiscrezioni secondo cui Astra potrebbe utilizzare una profondità ricorrente, talvolta descritta come transformer ad anello, ma OpenAI non ha confermato questa architettura. L’azienda ha dichiarato che Astra gestisce compiti più difficili verbalizzando una parte minore del proprio ragionamento e offre un controllo più preciso sulla traccia di ragionamento mostrata agli utenti.
Miglioramenti delle prestazioni e minore visibilità
Questo compromesso solleva interrogativi sulla supervisione. Se una parte maggiore del ragionamento di un modello resta nascosta, gli osservatori esterni dispongono di meno materiale per esaminare il modo in cui è arrivato a una risposta. Le stesse informazioni di OpenAI riconoscono che Astra è più difficile da monitorare attraverso l’ispezione visibile della catena di pensiero rispetto ai modelli precedenti, nonostante le sue prestazioni superiori.
Astra è stato annunciato il September 3 e successivamente reso disponibile tramite i piani ChatGPT Plus, Pro, Business ed Enterprise, oltre che attraverso l’API, Microsoft Azure e AWS Bedrock. Il prezzo indicato è di $10 per milione di token di input e $50 per milione di token di output, con una finestra di contesto di 1.05 milioni di token.
Il risultato di Astra nell’ARC-AGI-3 aggiunge una nuova misura delle sue capacità dopo il lancio. Suggerisce che il vantaggio del modello sia particolarmente pronunciato nei compiti che richiedono a un agente di formare e mantenere un modello di un ambiente sconosciuto. Allo stesso tempo, la grande differenza tra i test neutrale e specifico del fornitore mostra quanto gli esiti dei benchmark possano dipendere dagli strumenti e dalla memoria disponibili durante la valutazione.
Per ora, la classifica comparabile colloca Astra al 62.7%, Claude Opus 5 al 30.2% e il risultato verificato più recente di Grok al 2.11%. La domanda successiva è se Anthropic e xAI riusciranno a ridurre questo divario nelle stesse condizioni di test.