AI · · 3 min read

GPT-6 Astra ARC-AGI-3 বেঞ্চমার্কে নতুন রেকর্ড গড়েছে

OpenAI-এর GPT-6 Astra ARC-AGI-3-এ বড় ব্যবধানে এগিয়ে আছে, যদিও মূল্যায়নে যুক্তির অবস্থা কীভাবে সংরক্ষণ করা হচ্ছে তার ওপর ফলাফলে ব্যাপক পার্থক্য দেখা যায়।

ARC Prize ব্যবহৃত নিরপেক্ষ পরীক্ষাব্যবস্থায় OpenAI-এর GPT-6 Astra ARC-AGI-3 যুক্তি-বেঞ্চমার্কে নতুন উচ্চতা তৈরি করেছে, 62.7% স্কোর করে। Startup Fortune-এর প্রতিবেদনের অনুযায়ী, এই ফল আগের যাচাইকৃত ফ্রন্টিয়ার স্কোরের দ্বিগুণেরও বেশি।

এই সাফল্য অর্জনে যথেষ্ট খরচ হয়েছে। পরীক্ষার ফলাফলের সঙ্গে দেওয়া হিসাব অনুযায়ী, Astra-র সর্বোচ্চ reasoning সেটিংয়ে সম্পূর্ণ মূল্যায়নের খরচ পড়েছে প্রায় $26,000। এই স্কোর Astra-কে Claude Opus 5-এর অনেক ওপরে রাখছে, যা জুলাইয়ে 30.2% পেয়েছিল, এবং OpenAI-এর আগের শীর্ষ মডেল GPT-5.6 Sol-এরও ওপরে, যার স্কোর ছিল 7.8%।

ফলটি আরও তাৎপর্যপূর্ণ, কারণ এটি Standard harness-এর অধীনে তৈরি হয়েছে—এই ব্যবস্থার নকশাই এমন যে বিভিন্ন কোম্পানির মডেলকে একই মৌলিক শর্তে পরীক্ষা করা যায়। ফলে প্রতিযোগীদের সঙ্গে তুলনার জন্য Astra-র 62.7% স্কোরই সবচেয়ে কার্যকর সংখ্যা, যদিও OpenAI নিজস্ব পরীক্ষাব্যবস্থায় অনেক বেশি ফল পেয়েছে।

দুটি পরীক্ষা, দুটি সম্পূর্ণ ভিন্ন ফল

OpenAI-এর Provider Adapter harness-এর মাধ্যমে Astra-কে মূল্যায়ন করা হলে তার সর্বোচ্চ পর্যবেক্ষিত ফল বেড়ে 99.9%-এ পৌঁছায়। ওই পরীক্ষায় মডেলটি উচ্চ reasoning সেটিংয়ে চালানো হয়েছিল এবং খরচ হয়েছিল আনুমানিক $18,800। এটি Astra-র নতুন কোনো সংস্করণ ব্যবহারের ফল নয়; বরং মডেলের অভ্যন্তরীণ reasoning এক ধাপ থেকে পরের ধাপে কীভাবে বহন করা হয়েছে, তার পরিবর্তনের ফল।

ARC-AGI-3 মডেলগুলোকে এমন ইন্টার‌্যাক্টিভ ধাঁধা দেয়, যেখানে তাদের অপরিচিত পরিবেশ বুঝে তার ভেতরে কাজ করতে হয়। Standard harness-এ কোনো মডেল ইচ্ছাকৃতভাবে তৈরি করা নোট সংরক্ষণ করতে পারে, কিন্তু প্রতিটি অনুরোধের মধ্যবর্তী সময়ে তার ব্যক্তিগত reasoning state ধরে রাখা হয় না। প্রকাশ্য লিডারবোর্ডের প্রতিটি মডেলই এই সীমাবদ্ধতার মুখোমুখি হয়।

OpenAI-এর adapter Astra-কে একটি ধাঁধা চলাকালীন অস্পষ্ট reasoning state ধরে রাখতে এবং প্রয়োজন হলে সেই state সংকুচিত করতে দেয়। এই অতিরিক্ত ধারাবাহিকতার ফলেই দুটি ফলাফলের মধ্যে 37.2 পয়েন্টের পার্থক্য তৈরি হয়েছে। ARC Prize তাদের বিশ্লেষণে এই পার্থক্যটি চিহ্নিত করেছে, অর্থাৎ 99.9% ফলটিকে নিরপেক্ষ লিডারবোর্ডের স্কোরের সরাসরি সমতুল্য হিসেবে দেখা উচিত নয়।

তাই বিভিন্ন কোম্পানির তুলনার ক্ষেত্রে Standard ফলটিই বেশি গ্রহণযোগ্য বেঞ্চমার্ক হিসেবে রয়ে যায়। এই কঠোর শর্তেও Astra-র এগিয়ে থাকা যথেষ্ট বড়। Anthropic Claude Opus 5.5-এর কোনো যাচাইকৃত ARC-AGI-3 ফল প্রকাশ করেনি। Grok 4.6 একটি XHigh পরীক্ষায় 2.11% পেয়েছে, আর আগের Grok 4.5 এন্ট্রিগুলো 0.3%-এ পৌঁছেছিল; প্রতিবেদনে আলোচিত সময়ে লিডারবোর্ডে Grok 4.7-এর কোনো যাচাইকৃত ফল দেখা যায়নি।

আরও দক্ষ সমস্যা সমাধানের প্রমাণ

ARC Prize-এর বিশ্লেষণে শুধু শতাংশের স্কোরই দেখা হয়নি। পরীক্ষিত স্তরগুলোর 96%-এ Astra মধ্যম মানব অংশগ্রহণকারীর চেয়ে কম সংখ্যক action ব্যবহার করেছে। ওই কাজগুলোতে সমাধানে পৌঁছানোর আগে এটি গড়ে 51.7% কম move করেছে।

মডেলটি অপরিচিত গেমের জগতের সংক্ষিপ্ত প্রতীকী বর্ণনা তৈরি করে পরবর্তী action পরিকল্পনার সময় তা পুনর্ব্যবহার করেছে বলেও মনে হয়েছে। কোনো সুসংগত কার্যকরী মডেল ধরে না রেখে বারবার পরিবেশ যাচাই করার পদ্ধতি থেকে এটি আলাদা। বরং এটি নতুন একটি গেমের নিয়ম শেখা এবং খেলা চলতে থাকলে সেই বোঝাপড়া কাজে লাগানোর মতো।

এই ফলাফল Astra ঠিক কীভাবে তৈরি, তা নির্দিষ্টভাবে প্রতিষ্ঠা করে না। OpenAI মডেলটির স্থাপত্যের বিস্তারিত বিবরণ দেয়নি। কোম্পানিটির গবেষণার ভাইস প্রেসিডেন্ট এইডান ক্লার্ক বলেছেন, Astra-ই OpenAI-এর প্রথম মডেল, যা টেক্সাসে কোম্পানির Stargate সাইটে 100,000-এর বেশি GPU যুক্ত একটি training run-এ প্রশিক্ষিত হয়েছে। তিনি আরও বলেন, এটিই প্রথম training run, যেখানে আগের OpenAI মডেলগুলো তাদের উত্তরসূরির উন্নয়ন তদারকিতে সহায়তা করেছে।

AI গবেষক সেবাস্টিয়ান রাশকা এমন প্রতিবেদন নিয়ে আলোচনা করেছেন যে Astra হয়তো recurrent depth ব্যবহার করে, যাকে কখনও looped transformers বলা হয়; তবে OpenAI এই নকশা নিশ্চিত করেনি। কোম্পানিটি বলেছে, Astra আরও কঠিন কাজ সামলায়, অথচ তার reasoning-এর কম অংশ শব্দে প্রকাশ করে এবং ব্যবহারকারীদের দেখানো reasoning trace-এর ওপর আরও কঠোর নিয়ন্ত্রণ দেয়।

কর্মক্ষমতা বৃদ্ধি ও কম দৃশ্যমানতা

এই বিনিময় তদারকি নিয়ে প্রশ্ন তুলছে। কোনো মডেলের reasoning-এর বেশি অংশ যদি গোপন থাকে, তাহলে কীভাবে সেটি কোনো উত্তরে পৌঁছেছে তা পরীক্ষা করার মতো উপাদান বাইরের পর্যবেক্ষকদের হাতে কম থাকে। OpenAI-এর নিজস্ব তথ্যেও স্বীকার করা হয়েছে যে আগের মডেলগুলোর তুলনায় Astra-কে দৃশ্যমান chain-of-thought পরীক্ষা করে পর্যবেক্ষণ করা কঠিন, যদিও এর কর্মক্ষমতা বেশি।

Astra-র ঘোষণা দেওয়া হয়েছিল September 3-এ। পরে এটি ChatGPT Plus, Pro, Business এবং Enterprise প্ল্যানের পাশাপাশি API, Microsoft Azure ও AWS Bedrock-এর মাধ্যমে ব্যবহারযোগ্য করা হয়। এর তালিকাভুক্ত মূল্য প্রতি মিলিয়ন input token-এ $10 এবং প্রতি মিলিয়ন output token-এ $50; context window 1.05 million token।

ARC-AGI-3-এর ফল প্রকাশের পর Astra-র সক্ষমতার একটি নতুন পরিমাপ যোগ হয়েছে। এতে ইঙ্গিত মিলছে, অপরিচিত পরিবেশের একটি মডেল তৈরি ও বজায় রাখা প্রয়োজন—এমন কাজে মডেলটির সুবিধা বিশেষভাবে স্পষ্ট। একই সময়ে, নিরপেক্ষ ও provider-specific পরীক্ষার মধ্যে বড় পার্থক্য দেখায় যে মূল্যায়নের সময় ব্যবহারযোগ্য tools ও memory বেঞ্চমার্কের ফলকে কতটা প্রভাবিত করতে পারে।

এই মুহূর্তে তুলনাযোগ্য স্কোরবোর্ডে Astra 62.7%, Claude Opus 5 30.2% এবং সর্বশেষ যাচাইকৃত Grok ফল 2.11%-এ রয়েছে। একই পরীক্ষার শর্তে Anthropic এবং xAI এই ব্যবধান কমাতে পারে কি না, সেটিই এখন পরবর্তী প্রশ্ন।

artificial intelligenceai benchmarksopenaiarc-agi-3machine reasoningai safetytechnology

Continue reading

Read this in another language