
کلاد Opus 5 با جهشی بزرگ در ARC-AGI-3 رکورد GPT-5.6 Sol و Fable 5 را شکست
مدل کلاد Opus 5 از شرکت Anthropic با ثبت امتیاز ۳۰.۲ درصد در بنچمارک ARC-AGI-3 به صدر جدول این آزمون راه یافت و فاصلهای چشمگیر با رقبا ایجاد کرد چرا که رکورد قبلی این بنچمارک، یعنی ۷.۸ درصد، در اختیار GPT-5.6 Sol (Max) از OpenAI بود. همچنین Opus 5 از مدلهای کلاس Fable نیز پیشی گرفت که طبق اعلام ARC Prize به امتیازی نزدیک به ۲۰ درصد رسیدهاند. این مدل توانست پنج محیطی را که پیشتر هیچ مدلی موفق به حل آنها نشده بود، پشت سر بگذارد و در چهار مورد عملکردی همسطح یا بهتر از انسان ارائه دهد.
به گفته تحلیلگران ARC Prize، عامل اصلی این برتری بهبود قابلتوجه در توانایی استدلال منطقی است؛ قابلیتی که امکان اکتشاف، برنامهریزی و اجرای مستقلتر در محیطهای ناشناخته را فراهم میکند. پژوهشگران در جریان ارزیابیها با رفتارهایی روبهرو شدند که تاکنون در هیچ مدل زبانی مشاهده نشده بود. Opus 5 برای نخستین بار برخی وظایف را به نمادگذاری جبری تبدیل کرد و بهصورت مستقل معادلات بازاندیشی یا Reflection را فرمولبندی کرد. اکنون نیز از میان ۲۵ محیط آزمایشی عمومی این مجموعه، ۶ مورد با موفقیت حل شدهاند و نتایج کامل، بازپخش اجراها و کدهای بنچمارک بهصورت عمومی در دسترس قرار گرفته است.
در دیگر آزمونهای این مجموعه نیز Opus 5 عملکرد قدرتمندی از خود نشان داده است و این مدل در ARC-AGI-2 امتیاز ۹۰.۴ درصد و در ARC-AGI-1 امتیاز ۹۷.۵ درصد را به دست آورد؛ نتایجی که با بهترین رکوردهای قبلی برابری میکنند، اما طبق اعلام ARC Prize با هزینهای اندکی بالاتر حاصل شدهاند. ARC-AGI-3 برای سنجش توانایی مدلها در حل مسائل جدیدی طراحی شده که در زمان آموزش با آنها مواجه نبودهاند. در این آزمون مدل باید قوانین یک محیط تعاملی را کشف کرده، برای حل آن برنامهریزی کند و مراحل را بهترتیب اجرا کند؛ بنابراین تمرکز اصلی آن بر استدلال عمومی است، نه دانش از پیش آموختهشده.
ARC Prize همچنین تأکید میکند که برخی سامانههای هوش مصنوعی ممکن است با استفاده از نرمافزارهای کمکی موسوم به Harness بتوانند این آزمون را پشت سر بگذارند، اما امتیازهای رسمی تنها عملکرد خود مدل زبانی را محاسبه میکنند. از نگاه این مجموعه، سامانههای AGI آینده نباید برای حل وظایف جدید به ابزارهای خارجی وابسته باشند. بر همین اساس گفته میشود اگر Opus 5 در محیط Claude Code مورد استفاده قرار گیرد، احتمالاً امتیاز بالاتری نیز کسب خواهد کرد.

آنتروپیک هنوز توضیح رسمی درباره دلیل این پیشرفت منتشر نکرده است، اما برچسبگذاری هدفمند دادهها و استفاده از یادگیری تقویتی از مهمترین فرضیههای مطرحشده هستند. از آنجا که Opus 5 پس از معرفی عمومی ARC-AGI-3 توسعه یافته، این احتمال وجود دارد که فرایند آموزش آن روی مهارتها و قالب معماهای این بنچمارک متمرکز شده باشد، بدون آنکه الزاماً از همان وظایف اصلی برای آموزش استفاده شده باشد. همچنین ممکن است برچسبگذاران مسیرهای استدلال، اقدامات مفید، تلاشهای ناموفق و مراحل بازیابی را از معماهای مشابه استخراج کرده باشند و یادگیری تقویتی نیز برای تقویت اکتشاف، برنامهریزی، کشف قوانین و اصلاح خطاها به کار رفته باشد.
با این حال، نتایج بهدستآمده در Witness، بنچمارک خصوصی بازیهای معمایی تعاملی متعلق به Guanghan Ning، تصویر متفاوتی ارائه میدهد. Opus 5 در این آزمون امتیاز ۴۳.۴ را ثبت کرد و از نظر آماری همسطح Kimi K3 و Fable 5 قرار گرفت. میزان پیشرفت آن نسبت به Opus 4.8 نیز بسیار کمتر از جهشی بود که در ARC-AGI-3 مشاهده شد. این مدل در یکی از معماهای متعارف، قوانین پنهان را پیش از انجام هر اقدامی تشخیص داد، اما در بازیای با سازوکارهای کمتر آشنا، عملکردی ضعیفتر از Opus 4.8 داشت. Ning معتقد است چنین الگویی با آموزش روی دادههای اختصاصی یک ژانر خاص سازگار است، هرچند Witness نمیتواند مشخص کند آنتروپیک دقیقاً از چه دادههایی استفاده کرده است.
در مقابل، Greg Kamradt، از پژوهشگران ARC-AGI-3، میگوید این نتایج الزاماً به معنای محدود بودن پیشرفتهای استدلالی نیست. به باور او بازیهایی که بر پایه مکانیکهای آشنا طراحی شدهاند، توانایی سازگاری با موقعیتهای جدید را بهخوبی نمیسنجند و یک نتیجه ضعیف نیز بدون بررسی جزئیات کامل، نمیتواند روند کلی بهبود مدل را زیر سؤال ببرد. او همچنین یادآور شد که Witness نیز بر اساس معماهایی مشابه ARC-AGI-3 ساخته شده و به همین دلیل عملکرد بهتر میتواند حاصل انتقال واقعی تواناییها باشد، نه صرفاً حفظ کردن الگوها.
نینگ بعدها توضیح داد که Opus 5 در Witness نیز توانایی تعمیم را نشان داده، اما میزان این تعمیم بهمراتب کمتر از ARC-AGI-3 بوده است. او این روند را با تکامل بنچمارکهای برنامهنویسی مقایسه کرد و گفت همانطور که آزمونهایی مانند HumanEval بهتدریج جای خود را به رقابتهای دائماً بهروزشونده و عاملهای برنامهنویس امروزی دادهاند، ARC-AGI-3 نیز احتمالاً نخستین هدف اصلی آموزش مدلها خواهد بود و پوشش تدریجی موارد خاص میتواند در آینده به تعمیم بهتر توانایی استدلال انتزاعی منجر شود.




