AI · · 4 min read
GPT-6 Astra estabelece novo recorde no benchmark ARC-AGI-3
O GPT-6 Astra, da OpenAI, lidera o ARC-AGI-3 com ampla vantagem, embora seus resultados variem drasticamente dependendo de como a avaliação preserva o estado de raciocínio.
O GPT-6 Astra, da OpenAI, estabeleceu uma nova marca no benchmark de raciocínio ARC-AGI-3, alcançando 62,7% sob o sistema de testes neutro usado pela ARC Prize. O resultado é mais de duas vezes superior à pontuação de fronteira anteriormente verificada, segundo reportagem da Startup Fortune.
A conquista teve um custo considerável. Uma avaliação completa na configuração de raciocínio mais alta do Astra custou cerca de US$ 26.000, com base na estimativa fornecida com os resultados do teste. A pontuação coloca o Astra bem à frente do Claude Opus 5, que alcançou 30,2% em julho, e do modelo anterior líder da OpenAI, o GPT-5.6 Sol, que registrou 7,8%.
O resultado também é mais significativo porque foi produzido sob o Standard harness, projetado para aplicar as mesmas condições básicas a modelos de diferentes empresas. Isso faz da pontuação de 62,7% do Astra o número mais útil para compará-lo com concorrentes, embora a OpenAI tenha obtido um resultado muito mais alto sob seu próprio sistema de testes.
Dois testes, dois resultados muito diferentes
Quando o Astra foi avaliado por meio do Provider Adapter harness da OpenAI, seu melhor resultado observado subiu para 99,9%. Essa execução usou o modelo com alto nível de raciocínio e custou aproximadamente US$ 18.800. A mudança não foi uma nova versão do Astra, mas uma alteração na forma como o raciocínio interno do modelo era transportado de uma etapa para a seguinte.
O ARC-AGI-3 apresenta aos modelos quebra-cabeças interativos que exigem que eles compreendam ambientes desconhecidos e atuem dentro deles. No Standard harness, um modelo pode preservar anotações que cria deliberadamente, mas seu estado privado de raciocínio não é retido entre as solicitações. Todo modelo no ranking público enfrenta essa restrição.
O adaptador da OpenAI permite que o Astra retenha um estado de raciocínio opaco durante todo o quebra-cabeça e comprima esse estado quando necessário. Essa continuidade adicional produziu a diferença de 37,2 pontos entre os dois resultados. A ARC Prize identificou essa distinção em sua análise, o que significa que o número de 99,9% não deve ser tratado como diretamente equivalente à pontuação do ranking neutro.
Para comparações entre empresas, portanto, o resultado do Standard continua sendo o benchmark mais defensável. Mesmo sob esses termos mais rigorosos, a liderança do Astra é substancial. A Anthropic não divulgou um resultado verificado do ARC-AGI-3 para o Claude Opus 5.5. O Grok 4.6 alcançou 2,11% em uma execução XHigh, enquanto as entradas anteriores do Grok 4.5 chegaram a 0,3%; nenhum resultado verificado do Grok 4.7 aparecia no ranking no período abrangido pela reportagem.
Evidências de resolução de problemas mais eficiente
A análise da ARC Prize examinou mais do que a pontuação percentual. Em 96% dos níveis testados, o Astra usou menos ações do que o participante humano mediano. Nessas tarefas, ele teve, em média, 51,7% menos movimentos antes de chegar a uma solução.
O modelo também pareceu construir descrições simbólicas compactas de mundos de jogo desconhecidos e reutilizá-las ao planejar ações posteriores. Essa abordagem difere de sondar repetidamente um ambiente sem manter um modelo de trabalho coerente. Ela se assemelha mais a aprender as regras de um jogo novo e aplicar esse entendimento à medida que a partida prossegue.
Essas descobertas não estabelecem exatamente como o Astra é construído. A OpenAI não forneceu um relato detalhado da arquitetura do modelo. Aidan Clark, vice-presidente de pesquisa da empresa, disse que o Astra foi o primeiro modelo da OpenAI treinado em uma execução que envolveu mais de 100.000 GPUs na unidade Stargate da empresa no Texas. Ele também disse que foi a primeira execução de treinamento na qual modelos anteriores da OpenAI ajudaram a supervisionar o desenvolvimento de seu sucessor.
O pesquisador de IA Sebastian Raschka discutiu relatos de que o Astra pode usar profundidade recorrente, às vezes descrita como transformers em loop, mas a OpenAI não confirmou esse design. A empresa afirmou que o Astra lida com tarefas mais difíceis enquanto verbaliza menos seu raciocínio e oferece um controle mais preciso sobre o rastro de raciocínio mostrado aos usuários.
Ganhos de desempenho e menor visibilidade
Essa troca levanta questões sobre supervisão. Se uma parte maior do raciocínio de um modelo permanece oculta, observadores externos têm menos material para examinar como ele chegou a uma resposta. As próprias informações da OpenAI reconhecem que o Astra é mais difícil de monitorar por meio da inspeção visível da cadeia de raciocínio do que os modelos anteriores, apesar de seu desempenho superior.
O Astra foi anunciado em 3 de setembro e posteriormente disponibilizado nos planos ChatGPT Plus, Pro, Business e Enterprise, além da API, do Microsoft Azure e do AWS Bedrock. Seu preço divulgado é de US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída, com uma janela de contexto de 1,05 milhão de tokens.
O resultado do ARC-AGI-3 acrescenta uma nova medida das capacidades do Astra após seu lançamento. Ele sugere que a vantagem do modelo é especialmente acentuada em tarefas que exigem que um agente forme e mantenha um modelo de um ambiente desconhecido. Ao mesmo tempo, a grande diferença entre os testes neutro e específico do provedor mostra como os resultados de benchmarks podem depender fortemente das ferramentas e da memória disponíveis durante a avaliação.
Por enquanto, o placar comparável coloca o Astra em 62,7%, o Claude Opus 5 em 30,2% e o resultado mais recente verificado do Grok em 2,11%. A próxima questão é saber se a Anthropic e a xAI conseguirão reduzir essa diferença sob as mesmas condições de teste.