AI · · 4 min read
GPT-6 Astra établit un nouveau record au benchmark ARC-AGI-3
Le GPT-6 Astra d’OpenAI domine largement l’ARC-AGI-3, même si ses résultats varient fortement selon la manière dont l’évaluation conserve l’état de raisonnement.
Le GPT-6 Astra d’OpenAI a établi un nouveau record au benchmark de raisonnement ARC-AGI-3, avec un score de 62,7 % dans le système de test neutre utilisé par ARC Prize. Ce résultat représente plus du double du précédent meilleur score vérifié de modèles de pointe, selon un article de Startup Fortune.
Cette performance a toutefois été obtenue à un coût considérable. Une évaluation complète avec le niveau de raisonnement maximal d’Astra a coûté environ 26 000 $, d’après l’estimation fournie avec les résultats du test. Ce score place Astra largement devant Claude Opus 5, qui avait atteint 30,2 % en juillet, ainsi que devant le précédent modèle phare d’OpenAI, GPT-5.6 Sol, qui avait obtenu 7,8 %.
Le résultat est également plus significatif parce qu’il a été obtenu avec le banc d’essai Standard, conçu pour appliquer les mêmes conditions de base aux modèles de différentes entreprises. Le score de 62,7 % d’Astra constitue ainsi la donnée la plus utile pour le comparer à ses concurrents, même si OpenAI a obtenu un résultat bien supérieur avec son propre système de test.
Deux tests, deux résultats très différents
Lorsque Astra a été évalué avec le banc d’essai Provider Adapter d’OpenAI, son meilleur résultat observé est monté à 99,9 %. Cette exécution utilisait le modèle avec un niveau de raisonnement élevé et a coûté environ 18 800 $. Il ne s’agissait pas d’une nouvelle version d’Astra, mais d’un changement dans la manière dont le raisonnement interne du modèle était transmis d’une étape à l’autre.
L’ARC-AGI-3 soumet les modèles à des énigmes interactives qui leur demandent de comprendre des environnements inconnus et d’y agir. Avec le banc d’essai Standard, un modèle peut conserver les notes qu’il crée délibérément, mais son état de raisonnement privé n’est pas conservé entre les requêtes. Tous les modèles du classement public sont soumis à cette restriction.
L’adaptateur d’OpenAI permet à Astra de conserver un état de raisonnement opaque pendant toute la durée d’une énigme et de le compresser lorsque cela est nécessaire. Cette continuité supplémentaire explique l’écart de 37,2 points entre les deux résultats. ARC Prize a relevé cette distinction dans son analyse, ce qui signifie que le chiffre de 99,9 % ne doit pas être considéré comme directement équivalent au score obtenu sur le classement neutre.
Pour les comparaisons entre entreprises, le résultat Standard reste donc le benchmark le plus défendable. Même selon ces critères plus stricts, l’avance d’Astra est considérable. Anthropic n’a pas publié de résultat vérifié à l’ARC-AGI-3 pour Claude Opus 5.5. Grok 4.6 a obtenu 2,11 % lors d’une exécution XHigh, tandis que les précédentes entrées de Grok 4.5 avaient atteint 0,3 % ; aucun résultat vérifié de Grok 4.7 ne figurait dans le classement au moment couvert par l’article.
Des signes d’une résolution de problèmes plus efficace
L’analyse d’ARC Prize s’est intéressée à autre chose qu’au pourcentage obtenu. Sur 96 % des niveaux testés, Astra a utilisé moins d’actions que le participant humain médian. Pour ces tâches, il a effectué en moyenne 51,7 % de mouvements en moins avant de parvenir à une solution.
Le modèle semblait également construire des descriptions symboliques concises de mondes de jeu inconnus, puis les réutiliser pour planifier ses actions suivantes. Cette approche diffère du fait de sonder à plusieurs reprises un environnement sans conserver de modèle cohérent et opérationnel. Elle s’apparente davantage à l’apprentissage des règles d’un nouveau jeu, puis à l’application de cette compréhension au fil de la partie.
Ces résultats ne permettent pas d’établir précisément comment Astra est conçu. OpenAI n’a pas fourni de description détaillée de l’architecture du modèle. Aidan Clark, vice-président de la recherche de l’entreprise, a déclaré qu’Astra était le premier modèle d’OpenAI entraîné lors d’une campagne mobilisant plus de 100 000 GPU sur le site Stargate de l’entreprise, au Texas. Il a également indiqué qu’il s’agissait de la première campagne d’entraînement au cours de laquelle d’anciens modèles d’OpenAI avaient contribué à superviser le développement de leur successeur.
Le chercheur en IA Sebastian Raschka a évoqué des informations selon lesquelles Astra pourrait utiliser une profondeur récurrente, parfois décrite comme des transformeurs en boucle, mais OpenAI n’a pas confirmé cette architecture. L’entreprise a indiqué qu’Astra traitait des tâches plus difficiles tout en verbalisant moins son raisonnement et offrait un contrôle plus précis sur la trace de raisonnement affichée aux utilisateurs.
Gains de performance et visibilité réduite
Ce compromis soulève des questions concernant la supervision. Si une plus grande partie du raisonnement d’un modèle reste cachée, les observateurs externes disposent de moins de matière pour examiner la manière dont il est parvenu à une réponse. Les propres informations d’OpenAI reconnaissent qu’il est plus difficile de surveiller Astra au moyen de l’examen visible de sa chaîne de pensée que les modèles précédents, malgré ses performances supérieures.
Astra a été annoncé le 3 septembre, puis rendu disponible via les forfaits ChatGPT Plus, Pro, Business et Enterprise, ainsi que par l’intermédiaire de l’API, de Microsoft Azure et d’AWS Bedrock. Son tarif affiché est de 10 $ par million de jetons d’entrée et de 50 $ par million de jetons de sortie, avec une fenêtre de contexte de 1,05 million de jetons.
Le résultat obtenu à l’ARC-AGI-3 apporte une nouvelle mesure des capacités d’Astra après son lancement. Il suggère que l’avantage du modèle est particulièrement marqué dans les tâches qui exigent d’un agent qu’il construise et conserve un modèle d’un environnement inconnu. En parallèle, l’écart important entre les tests neutres et ceux propres au fournisseur montre à quel point les résultats d’un benchmark peuvent dépendre des outils et de la mémoire disponibles pendant l’évaluation.
Pour l’instant, le classement comparable place Astra à 62,7 %, Claude Opus 5 à 30,2 % et le dernier résultat vérifié de Grok à 2,11 %. La prochaine question sera de savoir si Anthropic et xAI peuvent réduire cet écart dans les mêmes conditions de test.