AI · · 3 min read
GPT-6 Astra يسجل رقماً قياسياً جديداً في معيار ARC-AGI-3
يتصدر GPT-6 Astra من OpenAI معيار ARC-AGI-3 بفارق كبير، رغم أن نتائجه تختلف بشدة تبعاً للطريقة التي يحافظ بها التقييم على حالة الاستدلال.
سجّل GPT-6 Astra من OpenAI رقماً قياسياً جديداً في معيار الاستدلال ARC-AGI-3، محققاً 62.7% في ظل نظام الاختبار المحايد الذي تستخدمه ARC Prize. ووفقاً لتقرير نشرته Startup Fortune، فإن النتيجة تزيد على ضعف أفضل نتيجة سابقة موثقة للنماذج المتقدمة.
جاء هذا الإنجاز بتكلفة كبيرة. فقد بلغت تكلفة إجراء تقييم كامل باستخدام أعلى إعدادات الاستدلال في Astra نحو $26,000، استناداً إلى التقدير المرفق بنتائج الاختبار. وتضع هذه النتيجة Astra في موقع متقدم بفارق كبير عن Claude Opus 5، الذي حقق 30.2% في يوليو، وعن النموذج السابق المتصدر من OpenAI، GPT-5.6 Sol، الذي سجل 7.8%.
وتكتسب النتيجة أهمية أكبر لأنها تحققت باستخدام بيئة الاختبار Standard، المصممة لتطبيق الشروط الأساسية نفسها على النماذج التابعة لشركات مختلفة. وهذا يجعل نتيجة Astra البالغة 62.7% الرقم الأكثر فائدة لمقارنتها بالمنافسين، رغم أن OpenAI حصلت على نتيجة أعلى بكثير باستخدام نظام الاختبار الخاص بها.
اختباران ونتيجتان مختلفتان جداً
عندما خضع Astra للتقييم عبر بيئة Provider Adapter الخاصة بـ OpenAI، ارتفعت أفضل نتيجة مرصودة له إلى 99.9%. وقد استخدم ذلك الاختبار النموذجَ عند مستوى استدلال مرتفع، وبلغت تكلفته نحو $18,800. ولم يكن التغيير إصداراً جديداً من Astra، بل تغييراً في الطريقة التي نُقلت بها حالة الاستدلال الداخلية للنموذج من خطوة إلى الخطوة التالية.
يقدم ARC-AGI-3 للنماذج ألغازاً تفاعلية تتطلب منها فهم بيئات غير مألوفة والتصرف داخلها. وفي بيئة الاختبار Standard، يمكن للنموذج الاحتفاظ بملاحظات ينشئها عمداً، لكن حالة استدلاله الخاصة لا تُحفظ بين الطلبات. ويواجه كل نموذج على لوحة المتصدرين العامة هذا القيد.
تتيح أداة OpenAI المكيِّفة لـ Astra الاحتفاظ بحالة استدلال مبهمة طوال اللغز، وضغط تلك الحالة عند الضرورة. وقد أدى هذا الاستمرار الإضافي إلى الفارق البالغ 37.2 نقطة بين النتيجتين. وقد حددت ARC Prize هذا الفرق في تحليلها، ما يعني أنه لا ينبغي التعامل مع نتيجة 99.9% باعتبارها مكافئة مباشرة لنتيجة لوحة المتصدرين المحايدة.
لذلك تظل نتيجة Standard هي المعيار الأكثر قابلية للدفاع عنه عند المقارنة بين الشركات. وحتى وفق هذه الشروط الأكثر صرامة، فإن تقدم Astra كبير. ولم تُصدر Anthropic نتيجة موثقة لـ ARC-AGI-3 تخص Claude Opus 5.5. وسجل Grok 4.6 نسبة 2.11% في اختبار XHigh، بينما بلغت نتائج Grok 4.5 السابقة 0.3%؛ ولم تظهر أي نتيجة موثقة لـ Grok 4.7 على لوحة المتصدرين في الفترة التي غطاها التقرير.
دليل على حل المشكلات بكفاءة أكبر
تجاوز تحليل ARC Prize نسبة النتيجة. ففي 96% من المستويات التي اختُبرت، استخدم Astra عدداً من الأفعال أقل من متوسط المشارك البشري. وعبر تلك المهام، بلغ متوسط عدد تحركاته قبل الوصول إلى الحل 51.7% أقل.
وبدا أن النموذج ينشئ أوصافاً رمزية موجزة لعوالم ألعاب غير مألوفة، ثم يعيد استخدامها عند التخطيط للأفعال اللاحقة. ويختلف هذا النهج عن استكشاف البيئة مراراً من دون الاحتفاظ بنموذج عملي متماسك. وهو أقرب إلى تعلم قواعد لعبة جديدة وتطبيق ذلك الفهم مع استمرار اللعب.
ولا تثبت هذه النتائج بالضبط كيفية بناء Astra. فلم تقدم OpenAI شرحاً مفصلاً لبنية النموذج. وقال أيدان كلارك، نائب رئيس الأبحاث في الشركة، إن Astra كان أول نموذج من OpenAI يُدرَّب في عملية شملت أكثر من 100,000 وحدة معالجة رسومية في موقع الشركة Stargate بولاية تكساس. وقال أيضاً إنه كان أول تدريب ساعدت فيه نماذج OpenAI السابقة على الإشراف على تطوير خليفتها.
وتحدث باحث الذكاء الاصطناعي سيباستيان راشكا عن تقارير تفيد بأن Astra قد يستخدم العمق التكراري، الذي يوصف أحياناً بأنه محولات حلقية، لكن OpenAI لم تؤكد هذا التصميم. وقالت الشركة إن Astra يتعامل مع مهام أكثر صعوبة مع التعبير عن قدر أقل من استدلاله شفهياً، ويوفر تحكماً أدق في مسار الاستدلال المعروض على المستخدمين.
مكاسب الأداء وتراجع مستوى الرؤية
يثير هذا التنازل أسئلة حول الرقابة. فإذا ظل قدر أكبر من استدلال النموذج مخفياً، فلن يتوفر للمراقبين الخارجيين قدر كافٍ من المواد لفحص الطريقة التي توصل بها إلى الإجابة. وتقر معلومات OpenAI الخاصة بأن مراقبة Astra عبر فحص سلسلة التفكير المرئية أصعب من مراقبة النماذج السابقة، رغم أداء Astra الأقوى.
أُعلن عن Astra في September 3، ثم أُتيح لاحقاً عبر خطط ChatGPT Plus وPro وBusiness وEnterprise، وكذلك عبر API وMicrosoft Azure وAWS Bedrock. ويبلغ سعره المعلن $10 لكل مليون رمز إدخال و$50 لكل مليون رمز إخراج، مع نافذة سياق تبلغ 1.05 مليون رمز.
تضيف نتيجة ARC-AGI-3 مقياساً جديداً لقدرات Astra بعد إطلاقه. وتشير إلى أن أفضلية النموذج تظهر بوضوح خاص في المهام التي تتطلب من وكيل تكوين نموذج لبيئة غير مألوفة والحفاظ عليه. وفي الوقت نفسه، يوضح الفارق الكبير بين الاختبار المحايد والاختبار الخاص بالمزوّد مدى اعتماد نتائج المعايير على الأدوات والذاكرة المتاحين أثناء التقييم.
في الوقت الراهن، تضع لوحة النتائج القابلة للمقارنة Astra عند 62.7%، وClaude Opus 5 عند 30.2%، وأحدث نتيجة موثقة لـ Grok عند 2.11%. والسؤال التالي هو ما إذا كانت Anthropic وxAI قادرتين على تقليص هذه الفجوة في ظل شروط الاختبار نفسها.