AI · · 5 min read

GPT-6 Astra ने ARC-AGI-3 बेंचमार्क का नया रिकॉर्ड बनाया

ओपनएआई का GPT-6 Astra ARC-AGI-3 में बड़े अंतर से सबसे आगे है, हालांकि मूल्यांकन में रीजनिंग स्टेट को किस तरह संरक्षित किया जाता है, इसके आधार पर इसके परिणामों में काफी भिन्नता आती है।

ओपनएआई के GPT-6 Astra ने ARC Prize द्वारा इस्तेमाल की गई निष्पक्ष परीक्षण प्रणाली के तहत ARC-AGI-3 रीजनिंग बेंचमार्क में 62.7% अंक हासिल कर नया उच्च स्तर बनाया है। Startup Fortune की रिपोर्ट के अनुसार, यह परिणाम पिछले सत्यापित फ्रंटियर स्कोर से दोगुने से भी अधिक है।

यह उपलब्धि काफी खर्च पर हासिल हुई। परीक्षण परिणामों के साथ दिए गए अनुमान के आधार पर, Astra की अधिकतम रीजनिंग सेटिंग पर पूर्ण मूल्यांकन की लागत लगभग $26,000 रही। इस स्कोर के साथ Astra, क्लॉड ओपस 5 से काफी आगे है, जिसने जुलाई में 30.2% अंक हासिल किए थे। यह ओपनएआई के पिछले अग्रणी मॉडल GPT-5.6 Sol के 7.8% अंक से भी बहुत आगे है।

यह परिणाम इसलिए भी अधिक अर्थपूर्ण है क्योंकि इसे Standard harness के तहत हासिल किया गया, जिसे अलग-अलग कंपनियों के मॉडलों पर समान बुनियादी स्थितियां लागू करने के लिए बनाया गया है। इससे Astra का 62.7% स्कोर प्रतिस्पर्धियों के साथ तुलना के लिए सबसे उपयोगी आंकड़ा बन जाता है, भले ही ओपनएआई ने अपनी परीक्षण प्रणाली के तहत इससे कहीं अधिक परिणाम हासिल किया हो।

दो परीक्षण, दो बिल्कुल अलग परिणाम

जब Astra का मूल्यांकन ओपनएआई के Provider Adapter harness के जरिए किया गया, तो उसका सर्वश्रेष्ठ देखा गया परिणाम बढ़कर 99.9% हो गया। इस परीक्षण में मॉडल को उच्च रीजनिंग पर चलाया गया और इसकी लागत लगभग $18,800 रही। यह बदलाव Astra के किसी नए संस्करण के कारण नहीं, बल्कि मॉडल की आंतरिक रीजनिंग को एक चरण से अगले चरण तक ले जाने के तरीके में बदलाव के कारण आया।

ARC-AGI-3 मॉडलों के सामने ऐसे इंटरैक्टिव पहेलियां रखता है, जिनमें उन्हें अपरिचित वातावरण को समझना और उसके भीतर काम करना होता है। Standard harness में कोई मॉडल अपने द्वारा जानबूझकर बनाए गए नोट्स सुरक्षित रख सकता है, लेकिन अनुरोधों के बीच उसकी निजी रीजनिंग स्थिति बरकरार नहीं रहती। सार्वजनिक लीडरबोर्ड पर मौजूद हर मॉडल इस प्रतिबंध का सामना करता है।

ओपनएआई का adapter Astra को पूरी पहेली के दौरान अपनी अपारदर्शी रीजनिंग स्थिति बनाए रखने और जरूरत पड़ने पर उसे संक्षिप्त करने की अनुमति देता है। इस अतिरिक्त निरंतरता के कारण दोनों परिणामों के बीच 37.2 अंक का अंतर पैदा हुआ। ARC Prize ने अपने विश्लेषण में इस अंतर को दर्ज किया है, इसलिए 99.9% के आंकड़े को निष्पक्ष लीडरबोर्ड स्कोर के सीधे समकक्ष के रूप में नहीं देखा जाना चाहिए।

कंपनियों के बीच तुलना के लिए Standard परिणाम इसलिए अधिक बचाव योग्य बेंचमार्क बना रहता है। इन अधिक कड़े मानकों पर भी Astra की बढ़त काफी बड़ी है। एंथ्रोपिक ने क्लॉड ओपस 5.5 के लिए सत्यापित ARC-AGI-3 परिणाम जारी नहीं किया है। Grok 4.6 ने XHigh परीक्षण में 2.11% अंक हासिल किए, जबकि इससे पहले के Grok 4.5 परिणाम 0.3% तक पहुंचे थे; रिपोर्ट में शामिल समय तक लीडरबोर्ड पर Grok 4.7 का कोई सत्यापित परिणाम दिखाई नहीं दिया।

अधिक कुशल समस्या-समाधान के प्रमाण

ARC Prize के विश्लेषण में प्रतिशत स्कोर से आगे की चीजों पर भी गौर किया गया। परीक्षण किए गए 96% स्तरों पर Astra ने औसत मानव प्रतिभागी से कम कार्रवाइयों का इस्तेमाल किया। इन कार्यों में समाधान तक पहुंचने से पहले उसने औसतन 51.7% कम चालें चलीं।

मॉडल अपरिचित गेम की दुनिया का संक्षिप्त प्रतीकात्मक विवरण तैयार करता और बाद की कार्रवाइयों की योजना बनाते समय उसका दोबारा इस्तेमाल करता हुआ भी दिखाई दिया। यह तरीका किसी सुसंगत कार्यशील मॉडल को बनाए रखे बिना वातावरण को बार-बार परखने से अलग है। यह किसी नए गेम के नियम सीखने और खेल जारी रहने के दौरान उस समझ को लागू करने के अधिक करीब है।

इन निष्कर्षों से यह निश्चित रूप से पता नहीं चलता कि Astra किस तरह बनाया गया है। ओपनएआई ने मॉडल की संरचना का विस्तृत विवरण नहीं दिया है। कंपनी के शोध उपाध्यक्ष एडन क्लार्क ने कहा कि Astra ओपनएआई का पहला मॉडल था, जिसे टेक्सस स्थित कंपनी के Stargate केंद्र में 100,000 से अधिक GPUs वाले प्रशिक्षण चरण में प्रशिक्षित किया गया। उन्होंने यह भी कहा कि यह पहला प्रशिक्षण चरण था जिसमें पहले के ओपनएआई मॉडलों ने अपने उत्तराधिकारी के विकास की निगरानी में मदद की।

एआई शोधकर्ता सेबास्टियन रास्का ने उन रिपोर्टों पर चर्चा की है जिनके अनुसार Astra में recurrent depth का इस्तेमाल हो सकता है, जिसे कभी-कभी looped transformers कहा जाता है, लेकिन ओपनएआई ने इस डिजाइन की पुष्टि नहीं की है। कंपनी ने कहा है कि Astra अपनी रीजनिंग को कम शब्दों में व्यक्त करते हुए अधिक कठिन कार्यों को संभालता है और उपयोगकर्ताओं को दिखाई जाने वाली रीजनिंग ट्रेस पर अधिक सख्त नियंत्रण देता है।

प्रदर्शन में बढ़ोतरी और कम दृश्यता

यह समझौता निगरानी को लेकर सवाल खड़े करता है। यदि किसी मॉडल की रीजनिंग का अधिक हिस्सा छिपा रहता है, तो बाहरी पर्यवेक्षकों के पास यह जांचने के लिए कम सामग्री होती है कि वह किसी उत्तर तक कैसे पहुंचा। ओपनएआई की अपनी जानकारी स्वीकार करती है कि पहले के मॉडलों की तुलना में Astra की दिखाई देने वाली chain-of-thought जांच के जरिए निगरानी करना अधिक कठिन है, भले ही उसका प्रदर्शन बेहतर हो।

Astra की घोषणा सितंबर 3 को की गई थी और बाद में इसे ChatGPT Plus, Pro, Business और Enterprise प्लान के साथ-साथ API, Microsoft Azure और AWS Bedrock के जरिए उपलब्ध कराया गया। इसकी सूचीबद्ध कीमत $10 प्रति मिलियन इनपुट टोकन और $50 प्रति मिलियन आउटपुट टोकन है, जबकि इसकी context window 1.05 मिलियन टोकन की है।

ARC-AGI-3 का परिणाम लॉन्च के बाद Astra की क्षमताओं का एक नया पैमाना प्रस्तुत करता है। इससे संकेत मिलता है कि ऐसे कार्यों में मॉडल की बढ़त खास तौर पर स्पष्ट है, जिनमें किसी एजेंट को अपरिचित वातावरण का मॉडल बनाना और उसे बनाए रखना होता है। साथ ही, निष्पक्ष और प्रदाता-विशिष्ट परीक्षणों के बीच बड़ा अंतर दिखाता है कि मूल्यांकन के दौरान उपलब्ध उपकरणों और मेमोरी पर बेंचमार्क के परिणाम कितनी मजबूती से निर्भर कर सकते हैं।

फिलहाल, तुलनीय स्कोरबोर्ड पर Astra 62.7%, क्लॉड ओपस 5 30.2% और नवीनतम सत्यापित Grok परिणाम 2.11% पर हैं। अगला सवाल यह है कि क्या एंथ्रोपिक और xAI समान परीक्षण स्थितियों में इस अंतर को कम कर सकते हैं।

artificial intelligenceai benchmarksopenaiarc-agi-3machine reasoningai safetytechnology

Continue reading

Read this in another language