AI · · 4 min read
GPT-6 Astra establece un nuevo récord en el benchmark ARC-AGI-3
El GPT-6 Astra de OpenAI lidera ARC-AGI-3 por un amplio margen, aunque sus resultados varían considerablemente según cómo la evaluación conserve el estado de razonamiento.
El GPT-6 Astra de OpenAI ha alcanzado un nuevo máximo en el benchmark de razonamiento ARC-AGI-3, con una puntuación del 62,7 % bajo el sistema de pruebas neutral utilizado por ARC Prize. El resultado es más del doble de la puntuación récord verificada anterior, según informó Startup Fortune.
El logro tuvo un coste considerable. Una evaluación completa con el nivel de razonamiento más alto de Astra costó unos 26.000 dólares, según la estimación facilitada con los resultados de la prueba. La puntuación sitúa a Astra muy por delante de Claude Opus 5, que alcanzó el 30,2 % en julio, y del anterior modelo líder de OpenAI, GPT-5.6 Sol, que registró un 7,8 %.
El resultado también es más significativo porque se obtuvo con el sistema Standard, diseñado para aplicar las mismas condiciones básicas a modelos de distintas empresas. Esto convierte la puntuación del 62,7 % de Astra en la cifra más útil para compararlo con sus competidores, aunque OpenAI obtuvo un resultado mucho más alto con su propio sistema de pruebas.
Dos pruebas, dos resultados muy diferentes
Cuando Astra fue evaluado mediante el sistema Provider Adapter de OpenAI, su mejor resultado observado ascendió al 99,9 %. Esa ejecución utilizó el modelo con un nivel alto de razonamiento y costó aproximadamente 18.800 dólares. No se trató de una nueva versión de Astra, sino de un cambio en la forma en que el razonamiento interno del modelo se trasladaba de un paso al siguiente.
ARC-AGI-3 presenta a los modelos rompecabezas interactivos que les exigen comprender entornos desconocidos y actuar en ellos. En el sistema Standard, un modelo puede conservar las notas que crea deliberadamente, pero su estado privado de razonamiento no se mantiene entre solicitudes. Todos los modelos de la clasificación pública están sujetos a esa restricción.
El adaptador de OpenAI permite a Astra conservar un estado de razonamiento opaco durante todo el rompecabezas y comprimirlo cuando es necesario. Esa continuidad adicional produjo la diferencia de 37,2 puntos entre ambos resultados. ARC Prize ha identificado esta distinción en su análisis, lo que significa que la cifra del 99,9 % no debe considerarse directamente equivalente a la puntuación de la clasificación neutral.
Por tanto, para las comparaciones entre empresas, el resultado de Standard sigue siendo el benchmark más defendible. Incluso en esas condiciones más estrictas, la ventaja de Astra es considerable. Anthropic no ha publicado un resultado verificado de ARC-AGI-3 para Claude Opus 5.5. Grok 4.6 obtuvo un 2,11 % en una ejecución XHigh, mientras que las entradas anteriores de Grok 4.5 llegaron al 0,3 %; en la clasificación no aparecía ningún resultado verificado de Grok 4.7 en el momento abarcado por el informe.
Pruebas de una resolución de problemas más eficiente
El análisis de ARC Prize examinó algo más que la puntuación porcentual. En el 96 % de los niveles probados, Astra utilizó menos acciones que el participante humano mediano. En esas tareas, realizó una media de un 51,7 % menos de movimientos antes de alcanzar una solución.
El modelo también pareció construir descripciones simbólicas compactas de mundos de juego desconocidos y reutilizarlas al planificar acciones posteriores. Este enfoque difiere de sondear repetidamente un entorno sin conservar un modelo de trabajo coherente. Se parece más a aprender las reglas de un juego nuevo y aplicar ese conocimiento a medida que continúa la partida.
Estos hallazgos no determinan exactamente cómo está construido Astra. OpenAI no ha proporcionado una descripción detallada de la arquitectura del modelo. Aidan Clark, vicepresidente de investigación de la empresa, dijo que Astra era el primer modelo de OpenAI entrenado en una ejecución que implicó más de 100.000 GPU en las instalaciones Stargate de la compañía en Texas. También dijo que era la primera ejecución de entrenamiento en la que modelos anteriores de OpenAI ayudaron a supervisar el desarrollo de su sucesor.
El investigador de IA Sebastian Raschka ha comentado informaciones según las cuales Astra podría utilizar profundidad recurrente, a veces descrita como transformadores en bucle, pero OpenAI no ha confirmado ese diseño. La empresa ha afirmado que Astra gestiona tareas más difíciles mientras verbaliza menos su razonamiento y ofrece un control más preciso sobre la traza de razonamiento que se muestra a los usuarios.
Mejoras de rendimiento y menor visibilidad
Ese equilibrio plantea dudas sobre la supervisión. Si una mayor parte del razonamiento de un modelo permanece oculta, los observadores externos disponen de menos material para examinar cómo llegó a una respuesta. La propia información de OpenAI reconoce que Astra es más difícil de monitorizar mediante la inspección visible de la cadena de pensamiento que los modelos anteriores, a pesar de su mayor rendimiento.
Astra se anunció el 3 de septiembre y posteriormente estuvo disponible a través de los planes ChatGPT Plus, Pro, Business y Enterprise, así como mediante la API, Microsoft Azure y AWS Bedrock. Su precio publicado es de 10 dólares por cada millón de tokens de entrada y 50 dólares por cada millón de tokens de salida, con una ventana de contexto de 1,05 millones de tokens.
El resultado de ARC-AGI-3 añade una nueva medida de las capacidades de Astra tras su lanzamiento. Sugiere que la ventaja del modelo es especialmente pronunciada en tareas que requieren que un agente forme y mantenga un modelo de un entorno desconocido. Al mismo tiempo, la gran diferencia entre las pruebas neutrales y las específicas del proveedor muestra hasta qué punto los resultados de un benchmark pueden depender de las herramientas y la memoria disponibles durante la evaluación.
Por ahora, la clasificación comparable sitúa a Astra en el 62,7 %, a Claude Opus 5 en el 30,2 % y el último resultado verificado de Grok en el 2,11 %. La siguiente cuestión es si Anthropic y xAI pueden reducir esa diferencia bajo las mismas condiciones de prueba.