CoreTech

Claude Opus 5

کلاد Opus 5 با جهشی بزرگ در ARC-AGI-3 رکورد GPT-5.6 Sol و Fable 5 را شکست

ابوالفضل | ۱۱ ساعت پیش

مدل کلاد Opus 5 از شرکت Anthropic با ثبت امتیاز ۳۰.۲ درصد در بنچمارک ARC-AGI-3 به صدر جدول این آزمون راه یافت و فاصله‌ای چشمگیر با رقبا ایجاد کرد چرا که رکورد قبلی این بنچمارک، یعنی ۷.۸ درصد، در اختیار GPT-5.6 Sol (Max) از OpenAI بود. همچنین Opus 5 از مدل‌های کلاس Fable نیز پیشی گرفت که طبق اعلام ARC Prize به امتیازی نزدیک به ۲۰ درصد رسیده‌اند. این مدل توانست پنج محیطی را که پیش‌تر هیچ مدلی موفق به حل آن‌ها نشده بود، پشت سر بگذارد و در چهار مورد عملکردی هم‌سطح یا بهتر از انسان ارائه دهد.

به گفته تحلیلگران ARC Prize، عامل اصلی این برتری بهبود قابل‌توجه در توانایی استدلال منطقی است؛ قابلیتی که امکان اکتشاف، برنامه‌ریزی و اجرای مستقل‌تر در محیط‌های ناشناخته را فراهم می‌کند. پژوهشگران در جریان ارزیابی‌ها با رفتارهایی روبه‌رو شدند که تاکنون در هیچ مدل زبانی مشاهده نشده بود. Opus 5 برای نخستین بار برخی وظایف را به نمادگذاری جبری تبدیل کرد و به‌صورت مستقل معادلات بازاندیشی یا Reflection را فرمول‌بندی کرد. اکنون نیز از میان ۲۵ محیط آزمایشی عمومی این مجموعه، ۶ مورد با موفقیت حل شده‌اند و نتایج کامل، بازپخش اجراها و کدهای بنچمارک به‌صورت عمومی در دسترس قرار گرفته است.

در دیگر آزمون‌های این مجموعه نیز Opus 5 عملکرد قدرتمندی از خود نشان داده است و این مدل در ARC-AGI-2 امتیاز ۹۰.۴ درصد و در ARC-AGI-1 امتیاز ۹۷.۵ درصد را به دست آورد؛ نتایجی که با بهترین رکوردهای قبلی برابری می‌کنند، اما طبق اعلام ARC Prize با هزینه‌ای اندکی بالاتر حاصل شده‌اند. ARC-AGI-3 برای سنجش توانایی مدل‌ها در حل مسائل جدیدی طراحی شده که در زمان آموزش با آن‌ها مواجه نبوده‌اند. در این آزمون مدل باید قوانین یک محیط تعاملی را کشف کرده، برای حل آن برنامه‌ریزی کند و مراحل را به‌ترتیب اجرا کند؛ بنابراین تمرکز اصلی آن بر استدلال عمومی است، نه دانش از پیش آموخته‌شده.

ARC Prize همچنین تأکید می‌کند که برخی سامانه‌های هوش مصنوعی ممکن است با استفاده از نرم‌افزارهای کمکی موسوم به Harness بتوانند این آزمون را پشت سر بگذارند، اما امتیازهای رسمی تنها عملکرد خود مدل زبانی را محاسبه می‌کنند. از نگاه این مجموعه، سامانه‌های AGI آینده نباید برای حل وظایف جدید به ابزارهای خارجی وابسته باشند. بر همین اساس گفته می‌شود اگر Opus 5 در محیط Claude Code مورد استفاده قرار گیرد، احتمالاً امتیاز بالاتری نیز کسب خواهد کرد.

آنتروپیک هنوز توضیح رسمی درباره دلیل این پیشرفت منتشر نکرده است، اما برچسب‌گذاری هدفمند داده‌ها و استفاده از یادگیری تقویتی از مهم‌ترین فرضیه‌های مطرح‌شده هستند. از آنجا که Opus 5 پس از معرفی عمومی ARC-AGI-3 توسعه یافته، این احتمال وجود دارد که فرایند آموزش آن روی مهارت‌ها و قالب معماهای این بنچمارک متمرکز شده باشد، بدون آنکه الزاماً از همان وظایف اصلی برای آموزش استفاده شده باشد. همچنین ممکن است برچسب‌گذاران مسیرهای استدلال، اقدامات مفید، تلاش‌های ناموفق و مراحل بازیابی را از معماهای مشابه استخراج کرده باشند و یادگیری تقویتی نیز برای تقویت اکتشاف، برنامه‌ریزی، کشف قوانین و اصلاح خطاها به کار رفته باشد.

با این حال، نتایج به‌دست‌آمده در Witness، بنچمارک خصوصی بازی‌های معمایی تعاملی متعلق به Guanghan Ning، تصویر متفاوتی ارائه می‌دهد. Opus 5 در این آزمون امتیاز ۴۳.۴ را ثبت کرد و از نظر آماری هم‌سطح Kimi K3 و Fable 5 قرار گرفت. میزان پیشرفت آن نسبت به Opus 4.8 نیز بسیار کمتر از جهشی بود که در ARC-AGI-3 مشاهده شد. این مدل در یکی از معماهای متعارف، قوانین پنهان را پیش از انجام هر اقدامی تشخیص داد، اما در بازی‌ای با سازوکارهای کمتر آشنا، عملکردی ضعیف‌تر از Opus 4.8 داشت. Ning معتقد است چنین الگویی با آموزش روی داده‌های اختصاصی یک ژانر خاص سازگار است، هرچند Witness نمی‌تواند مشخص کند آنتروپیک دقیقاً از چه داده‌هایی استفاده کرده است.

در مقابل، Greg Kamradt، از پژوهشگران ARC-AGI-3، می‌گوید این نتایج الزاماً به معنای محدود بودن پیشرفت‌های استدلالی نیست. به باور او بازی‌هایی که بر پایه مکانیک‌های آشنا طراحی شده‌اند، توانایی سازگاری با موقعیت‌های جدید را به‌خوبی نمی‌سنجند و یک نتیجه ضعیف نیز بدون بررسی جزئیات کامل، نمی‌تواند روند کلی بهبود مدل را زیر سؤال ببرد. او همچنین یادآور شد که Witness نیز بر اساس معماهایی مشابه ARC-AGI-3 ساخته شده و به همین دلیل عملکرد بهتر می‌تواند حاصل انتقال واقعی توانایی‌ها باشد، نه صرفاً حفظ کردن الگوها.

نینگ بعدها توضیح داد که Opus 5 در Witness نیز توانایی تعمیم را نشان داده، اما میزان این تعمیم به‌مراتب کمتر از ARC-AGI-3 بوده است. او این روند را با تکامل بنچمارک‌های برنامه‌نویسی مقایسه کرد و گفت همان‌طور که آزمون‌هایی مانند HumanEval به‌تدریج جای خود را به رقابت‌های دائماً به‌روزشونده و عامل‌های برنامه‌نویس امروزی داده‌اند، ARC-AGI-3 نیز احتمالاً نخستین هدف اصلی آموزش مدل‌ها خواهد بود و پوشش تدریجی موارد خاص می‌تواند در آینده به تعمیم بهتر توانایی استدلال انتزاعی منجر شود.

منبع

ابوالفضل | ۱۱ ساعت پیش

دیدگاهتان را بنویسید