AI · · 5 min read
GPT-6 Astra نے ARC-AGI-3 کا نیا بینچ مارک ریکارڈ قائم کر دیا
OpenAI کا GPT-6 Astra ARC-AGI-3 میں بڑے فرق سے سب سے آگے ہے، تاہم اس کے نتائج اس بات کے لحاظ سے نمایاں طور پر بدل جاتے ہیں کہ جائزے کے دوران استدلالی حالت کو کس طرح محفوظ رکھا جاتا ہے۔
OpenAI کے GPT-6 Astra نے ARC-AGI-3 کے استدلالی بینچ مارک پر نئی بلند ترین سطح قائم کرتے ہوئے 62.7% اسکور کیا ہے۔ یہ نتیجہ ARC Prize کے زیرِ استعمال غیر جانب دار آزمائشی نظام کے تحت حاصل کیا گیا۔ Startup Fortune کی رپورٹنگ کے مطابق یہ اسکور سابقہ تصدیق شدہ فرنٹیئر اسکور سے دگنے سے بھی زیادہ ہے۔
یہ کامیابی خاصی زیادہ لاگت پر حاصل ہوئی۔ ٹیسٹ کے نتائج کے ساتھ فراہم کیے گئے تخمینے کی بنیاد پر Astra کی اعلیٰ ترین استدلالی ترتیب پر مکمل جائزے کی لاگت تقریباً $26,000 رہی۔ اس اسکور کے باعث Astra، Claude Opus 5 سے کہیں آگے ہے، جس نے جولائی میں 30.2% حاصل کیے تھے، جبکہ OpenAI کے سابقہ سرکردہ ماڈل GPT-5.6 Sol نے 7.8% اسکور کیا تھا۔
یہ نتیجہ اس لیے بھی زیادہ بامعنی ہے کہ اسے Standard ہارنس کے تحت حاصل کیا گیا، جسے مختلف کمپنیوں کے ماڈلز پر یکساں بنیادی حالات لاگو کرنے کے لیے بنایا گیا ہے۔ اس وجہ سے Astra کا 62.7% اسکور حریفوں کے ساتھ موازنے کے لیے سب سے زیادہ مفید عدد ہے، اگرچہ OpenAI نے اپنے آزمائشی نظام کے تحت اس سے کہیں زیادہ نتیجہ حاصل کیا۔
دو ٹیسٹ، دو بالکل مختلف نتائج
جب Astra کا OpenAI کے Provider Adapter ہارنس کے ذریعے جائزہ لیا گیا تو اس کا بہترین مشاہدہ شدہ نتیجہ بڑھ کر 99.9% ہو گیا۔ اس آزمائش میں ماڈل کو اعلیٰ استدلالی سطح پر استعمال کیا گیا اور اس کی لاگت تقریباً $18,800 رہی۔ یہ تبدیلی Astra کے کسی نئے ورژن کی وجہ سے نہیں، بلکہ اس طریقے میں تبدیلی کی وجہ سے تھی جس کے ذریعے ماڈل کی اندرونی استدلالی کیفیت ایک مرحلے سے اگلے مرحلے تک منتقل کی گئی۔
ARC-AGI-3 ماڈلز کو ایسے باہمی تعامل والے معمے پیش کرتا ہے جن کے لیے انہیں نامانوس ماحول کو سمجھنے اور اس کے اندر عمل کرنے کی ضرورت ہوتی ہے۔ Standard ہارنس میں کوئی ماڈل اپنے بنائے ہوئے نوٹس محفوظ رکھ سکتا ہے، لیکن اس کی نجی استدلالی حالت درخواستوں کے درمیان برقرار نہیں رہتی۔ عوامی لیڈر بورڈ پر موجود ہر ماڈل کو اسی پابندی کا سامنا ہے۔
OpenAI کا ایڈاپٹر Astra کو پورے معمے کے دوران غیر شفاف استدلالی حالت برقرار رکھنے اور ضرورت پڑنے پر اسے مختصر کرنے کی اجازت دیتا ہے۔ اس اضافی تسلسل نے دونوں نتائج کے درمیان 37.2 پوائنٹس کا فرق پیدا کیا۔ ARC Prize نے اپنے تجزیے میں اس فرق کی نشاندہی کی ہے، جس کا مطلب ہے کہ 99.9% کے عدد کو غیر جانب دار لیڈر بورڈ اسکور کے براہِ راست مساوی نہیں سمجھنا چاہیے۔
کمپنیوں کے درمیان موازنے کے لیے Standard نتیجہ اسی لیے زیادہ قابلِ دفاع بینچ مارک ہے۔ ان زیادہ سخت شرائط کے تحت بھی Astra کی برتری نمایاں ہے۔ Anthropic نے Claude Opus 5.5 کے لیے ARC-AGI-3 کا تصدیق شدہ نتیجہ جاری نہیں کیا۔ Grok 4.6 نے XHigh آزمائش میں 2.11% اسکور کیا، جبکہ Grok 4.5 کے پہلے اندراجات 0.3% تک پہنچے تھے؛ رپورٹ میں شامل وقت تک لیڈر بورڈ پر Grok 4.7 کا کوئی تصدیق شدہ نتیجہ ظاہر نہیں ہوا تھا۔
زیادہ مؤثر مسئلہ حل کرنے کے شواہد
ARC Prize کے تجزیے میں صرف فی صد اسکور پر توجہ نہیں دی گئی۔ جانچے گئے 96% مراحل میں Astra نے انسانی شرکا کے درمیانی اسکور سے کم اقدامات استعمال کیے۔ ان کاموں میں حل تک پہنچنے سے پہلے اس نے اوسطاً 51.7% کم چالیں چلیں۔
یہ بھی دکھائی دیا کہ ماڈل نامانوس کھیل کی دنیاؤں کی مختصر علامتی وضاحتیں تشکیل دیتا اور بعد کے اقدامات کی منصوبہ بندی کرتے وقت انہیں دوبارہ استعمال کرتا ہے۔ یہ طریقہ کسی مربوط عملی ماڈل کو برقرار رکھے بغیر بار بار ماحول کو پرکھنے سے مختلف ہے۔ یہ نئے کھیل کے قواعد سیکھنے اور کھیل جاری رہنے کے ساتھ اس سمجھ بوجھ کو بروئے کار لانے سے زیادہ مشابہت رکھتا ہے۔
یہ نتائج قطعی طور پر یہ ثابت نہیں کرتے کہ Astra کیسے بنایا گیا ہے۔ OpenAI نے ماڈل کے فنِ تعمیر کی تفصیلی وضاحت فراہم نہیں کی۔ کمپنی کے نائب صدر برائے تحقیق ایڈن کلارک نے کہا کہ Astra OpenAI کا پہلا ماڈل تھا جسے کمپنی کی ٹیکساس میں واقع Stargate سائٹ پر 100,000 سے زیادہ GPUs پر مشتمل ایک تربیتی عمل میں تیار کیا گیا۔ انہوں نے یہ بھی کہا کہ یہ پہلا تربیتی عمل تھا جس میں OpenAI کے پہلے ماڈلز نے اپنے جانشین کی تیاری کی نگرانی میں مدد کی۔
AI محقق سیباسٹین راشکا نے ان رپورٹس پر گفتگو کی ہے کہ Astra شاید recurrent depth استعمال کرتا ہے، جسے کبھی کبھار looped transformers بھی کہا جاتا ہے، لیکن OpenAI نے اس ڈیزائن کی تصدیق نہیں کی۔ کمپنی کا کہنا ہے کہ Astra زیادہ مشکل کام انجام دیتے ہوئے اپنے استدلال کو کم الفاظ میں بیان کرتا ہے اور صارفین کو دکھائی جانے والی reasoning trace پر زیادہ سخت کنٹرول فراہم کرتا ہے۔
کارکردگی میں بہتری اور کم ہوتی ہوئی شفافیت
یہ سمجھوتا نگرانی سے متعلق سوالات اٹھاتا ہے۔ اگر ماڈل کے استدلال کا زیادہ حصہ پوشیدہ رہے تو بیرونی مبصرین کے پاس اس بات کا جائزہ لینے کے لیے کم مواد رہ جاتا ہے کہ وہ کسی جواب تک کیسے پہنچا۔ OpenAI کی اپنی معلومات تسلیم کرتی ہیں کہ Astra کی کارکردگی بہتر ہونے کے باوجود، پہلے کے ماڈلز کے مقابلے میں دکھائی دینے والی chain-of-thought جانچ کے ذریعے اس کی نگرانی کرنا زیادہ مشکل ہے۔
Astra کا اعلان September 3 کو کیا گیا تھا، جس کے بعد اسے ChatGPT Plus، Pro، Business اور Enterprise منصوبوں کے ساتھ ساتھ API، Microsoft Azure اور AWS Bedrock کے ذریعے بھی دستیاب کر دیا گیا۔ اس کی درج شدہ قیمت $10 فی ملین input tokens اور $50 فی ملین output tokens ہے، جبکہ اس کی context window 1.05 million tokens پر مشتمل ہے۔
ARC-AGI-3 کا نتیجہ لانچ کے بعد Astra کی صلاحیتوں کا ایک نیا پیمانہ فراہم کرتا ہے۔ اس سے ظاہر ہوتا ہے کہ ایسے کاموں میں ماڈل کی برتری خاص طور پر نمایاں ہے جن میں کسی ایجنٹ کو نامانوس ماحول کا ایک ماڈل تشکیل دے کر برقرار رکھنا ہوتا ہے۔ اسی وقت، غیر جانب دار اور فراہم کنندہ کے مخصوص ٹیسٹوں کے درمیان بڑا فرق دکھاتا ہے کہ جائزے کے دوران دستیاب ٹولز اور میموری بینچ مارک کے نتائج پر کس قدر اثر انداز ہو سکتے ہیں۔
فی الحال قابلِ موازنہ اسکور بورڈ پر Astra 62.7%، Claude Opus 5 30.2% اور Grok کا تازہ ترین تصدیق شدہ نتیجہ 2.11% پر ہے۔ اگلا سوال یہ ہے کہ آیا Anthropic اور xAI انہی آزمائشی شرائط کے تحت اس فرق کو کم کر سکتے ہیں۔