AI · · 3 min read

GPT-6 Astra установила новый рекорд в бенчмарке ARC-AGI-3

GPT-6 Astra от OpenAI с большим отрывом лидирует в ARC-AGI-3, однако её результаты резко различаются в зависимости от того, как система тестирования сохраняет состояние рассуждений.

GPT-6 Astra от OpenAI установила новый рекорд в бенчмарке рассуждений ARC-AGI-3, набрав 62,7% в рамках нейтральной системы тестирования, используемой ARC Prize. Согласно материалу Startup Fortune, этот результат более чем вдвое превышает предыдущий подтверждённый показатель передовых моделей.

Достижение обошлось очень дорого. Полная оценка Astra на максимальной настройке рассуждений стоила около $26 000 — такая сумма указана в расчёте, приложенном к результатам теста. Этот показатель выводит Astra далеко вперёд по сравнению с Claude Opus 5, набравшей в июле 30,2%, и предыдущей лидирующей моделью OpenAI, GPT-5.6 Sol, результат которой составил 7,8%.

Результат имеет ещё большее значение, поскольку был получен с использованием стандартного тестового контура, призванного применять одинаковые базовые условия к моделям разных компаний. Поэтому показатель Astra в 62,7% — наиболее полезная цифра для сравнения с конкурентами, хотя в собственной системе тестирования OpenAI получила гораздо более высокий результат.

Два теста, два совершенно разных результата

При оценке Astra с помощью тестового контура Provider Adapter от OpenAI её лучший зафиксированный результат вырос до 99,9%. В этом прогоне модель работала с высоким уровнем рассуждений, а его стоимость составила примерно $18 800. Изменилась не новая версия Astra, а способ переноса внутреннего рассуждения модели с одного шага на следующий.

ARC-AGI-3 предлагает моделям интерактивные головоломки, требующие понять незнакомую среду и действовать в ней. В стандартном тестовом контуре модель может сохранять заметки, которые она создаёт намеренно, однако её скрытое состояние рассуждений не сохраняется между запросами. Все модели в публичной таблице лидеров сталкиваются с этим ограничением.

Адаптер OpenAI позволяет Astra сохранять непрозрачное состояние рассуждений на протяжении всей головоломки и при необходимости сжимать это состояние. Такая дополнительная непрерывность и привела к разнице в 37,2 процентного пункта между двумя результатами. ARC Prize указала на это различие в своём анализе, а значит, показатель 99,9% не следует считать напрямую эквивалентным результату в нейтральной таблице лидеров.

Поэтому для сравнений между компаниями стандартный результат остаётся более обоснованным ориентиром. Даже при таких строгих условиях отрыв Astra значителен. Anthropic не публиковала подтверждённый результат Claude Opus 5.5 в ARC-AGI-3. Grok 4.6 набрала 2,11% в прогоне XHigh, тогда как более ранние результаты Grok 4.5 достигали 0,3%; на момент, охватываемый отчётом, в таблице лидеров не было подтверждённого результата Grok 4.7.

Признаки более эффективного решения задач

В анализе ARC Prize внимание уделялось не только процентному результату. На 96% проверенных уровней Astra использовала меньше действий, чем средний участник- человек. В этих задачах она в среднем совершала на 51,7% меньше ходов до достижения решения.

Модель также, по-видимому, создавала компактные символические описания незнакомых игровых миров и повторно использовала их при планировании последующих действий. Такой подход отличается от многократного исследования среды методом проб без сохранения целостной рабочей модели. Он больше напоминает изучение правил новой игры и применение этого понимания по мере продолжения игры.

Эти выводы не позволяют точно установить, как устроена Astra. OpenAI не предоставила подробного описания архитектуры модели. Эйдан Кларк, вице-президент компании по исследованиям, заявил, что Astra стала первой моделью OpenAI, обученной в рамках запуска с участием более 100 000 GPU на принадлежащей компании площадке Stargate в Техасе. Он также сказал, что это был первый запуск обучения, в котором более ранние модели OpenAI помогали контролировать разработку своего преемника.

Исследователь ИИ Себастьян Рашка обсуждал сообщения о том, что Astra может использовать рекуррентную глубину, которую иногда описывают как трансформеры с зацикливанием, однако OpenAI не подтвердила такую архитектуру. Компания заявила, что Astra справляется с более сложными задачами, при этом меньше вербализуя свои рассуждения, и обеспечивает более точный контроль над цепочкой рассуждений, показываемой пользователям.

Рост производительности и снижение прозрачности

Такой компромисс вызывает вопросы об эффективности надзора. Если большая часть рассуждений модели остаётся скрытой, внешним наблюдателям доступно меньше материала для анализа того, как она пришла к ответу. В собственных материалах OpenAI признаётся, что за Astra сложнее следить с помощью анализа видимой цепочки рассуждений, чем за более ранними моделями, несмотря на её более высокую производительность.

Astra была представлена 3 сентября, а впоследствии стала доступна в планах ChatGPT Plus, Pro, Business и Enterprise, а также через API, Microsoft Azure и AWS Bedrock. Указанная цена составляет $10 за миллион входных токенов и $50 за миллион выходных токенов, а размер контекстного окна — 1,05 миллиона токенов.

Результат ARC-AGI-3 добавляет новый показатель возможностей Astra после её запуска. Он указывает на то, что преимущество модели особенно заметно в задачах, требующих от агента сформировать и поддерживать модель незнакомой среды. В то же время большая разница между нейтральным тестированием и тестированием в системе разработчика показывает, насколько сильно результаты бенчмарков могут зависеть от доступных во время оценки инструментов и памяти.

На данный момент в сопоставимой таблице Astra занимает первое место с результатом 62,7%, Claude Opus 5 — 30,2%, а последний подтверждённый результат Grok составляет 2,11%. Следующий вопрос заключается в том, смогут ли Anthropic и xAI сократить этот разрыв при одинаковых условиях тестирования.

artificial intelligenceai benchmarksopenaiarc-agi-3machine reasoningai safetytechnology

Continue reading

Read this in another language