CoreTech

Claude Opus 5

کلاد Opus 5 با نصف هزینه Fable 5 و رکوردهای تازه در برنامه‌نویسی معرفی شد

ابوالفضل | ۱ ساعت پیش

کلاد از مدل جدید Claude Opus 5 رونمایی کرد؛ مدلی که با حفظ قیمت Opus 4.8، عملکردی بسیار بهتر ارائه می‌دهد و به گفته این شرکت، با نیمی از هزینه به سطح هوشی Claude Fable 5 نزدیک می‌شود. Opus 5 از امروز در دسترس قرار گرفته و در ارزیابی‌های برنامه‌نویسی و کارهای دانشی مانند Frontier-Bench و GDPval-AA به صدر جدول رسیده است، اما در وظایف امنیت سایبری همچنان پایین‌تر از Mythos 5 قرار دارد.

کلاد Opus 5 از امروز روی همه پلتفرم‌ها عرضه شده و اکنون مدل پیش‌فرض مشترکان Claude Max است و این مدل همچنین قدرتمندترین گزینه موجود برای کاربران Claude Pro محسوب می‌شود. Claude اعلام می‌کند Opus 5 با همان قیمت Opus 4.8 عرضه شده، اما در تمامی سطوح تنظیم Effort عملکرد بهتری ارائه می‌دهد. کاربران می‌توانند این تنظیم را برای دستیابی به هوش بیشتر یا کاهش مصرف توکن و دریافت پاسخ‌های سریع‌تر و ارزان‌تر تغییر دهند.

نتایج منتشرشده نشان می‌دهد Opus 5 در وظایف مهندسی نرم‌افزار پیشرفت قابل‌توجهی داشته است و این مدل در آزمون Frontier-Bench v0.1 از همه رقبا پیشی گرفته و با وجود کاهش هزینه هر وظیفه، بیش از دو برابر بهتر از Opus 4.8 عمل کرده است. همچنین در CursorBench 3.2 و بالاترین سطح Effort، تنها ۰.۵ درصد با بهترین امتیاز Fable 5 فاصله دارد، اما هزینه اجرای هر وظیفه آن نصف است.

Opus 5 در دیگر ارزیابی‌های مهم نیز نتایج چشمگیری ثبت کرده و در آزمون ARC-AGI 3، که توانایی مدل‌ها را در حل مسائل جدید می‌سنجد، امتیاز این مدل سه برابر نزدیک‌ترین رقیب گزارش شده است. همچنین در Zapier AutomationBench، نرخ موفقیت آن در انجام کامل وظایف تجاری با هزینه یکسان برای هر وظیفه، حدود ۱.۵ برابر بهترین مدل بعدی است. حتی در پایین‌ترین سطح Effort نیز Opus 5 وظایف بیشتری را نسبت به همه رقبا با موفقیت انجام می‌دهد.

Opus 5 در ارزیابی OSWorld 2.0 نیز عملکرد قابل‌توجهی از خود نشان داده، این آزمون توانایی مدل‌ها در استفاده از رایانه را می‌سنجد و طبق نتایج منتشرشده، Opus 5 در هر سطح هزینه از تمام مدل‌های دیگر عملکرد بهتری دارد. این مدل حتی توانسته بهترین نتیجه Claude Fable 5 را نیز با صرف تنها کمی بیش از یک‌سوم هزینه پشت سر بگذارد و در چندین ارزیابی مرتبط دیگر نیز به بهترین و مقرون‌به‌صرفه‌ترین مدل Claude تبدیل شود.

کلاد می‌گوید Opus 5 در پژوهش‌های علمی نیز نسبت به Opus 4.8 پیشرفت محسوسی داشته و این مدل در تمام ارزیابی‌های علوم زیستی، از جمله زیست‌شناسی ساختاری، شیمی آلی و بیوانفورماتیک، عملکرد بهتری ثبت کرده است. بیشترین پیشرفت در وظایف شیمی آلی مشاهده شده؛ جایی که توانایی استنتاج ساختار مولکول‌ها از داده‌های طیف‌سنجی، در معیار داخلی کلاد، ۱۰.۲ درصد نسبت به Opus 4.8 افزایش یافته است.

در بخش دیگری از ارزیابی‌های علوم زیستی، Opus 5 در وظایف مرتبط با پروتئین‌ها نیز عملکرد بهتری از خود نشان داده است. این مدل در پیش‌بینی تأثیر تغییرات توالی پروتئین بر نحوه عملکرد آن، ۷.۷ درصد امتیاز بیشتری نسبت به Opus 4.8 کسب کرده است. Claude همچنین اعلام می‌کند این مدل قادر به تولید خروجی‌های بصری بسیار قوی‌تر از نسل قبل است و در این زمینه نیز پیشرفت محسوسی داشته است.

به گفته Claude، مدل جدید در بررسی دوباره نتایج، راستی‌آزمایی پاسخ‌ها و اصلاح مرحله‌به‌مرحله آن‌ها نیز توانمندتر از گذشته عمل می‌کند. این شرکت و کاربران نسخه دسترسی زودهنگام نمونه‌های متعددی از دقت و استقلال عمل مدل را گزارش کرده‌اند. یکی از شاخص‌ترین نمونه‌ها به آزمونی در Frontier-Bench مربوط می‌شود که در آن از مدل خواسته شد تنها با استفاده از یک تصویر، یک قطعه مکانیکی را در FreeCAD بازسازی کند.

در این آزمون دسترسی مستقیم اوپس ۵ به تصویر قطعه عمداً مسدود شده بود و با وجود این محدودیت، مدل یک سامانه بینایی ماشین اختصاصی نوشت تا هندسه قطعه را از پیکسل‌های خام استخراج کند و سپس کد لازم برای بازسازی کامل مدل سه‌بعدی را تولید کرد. Claude می‌گوید مدل جدید این کار را بارها با موفقیت انجام داد، اما هیچ‌یک از مدل‌های رقیب با همین شرایط حتی پس از پنج تلاش نیز موفق به حل مسئله نشدند.

نمونه دیگری از توانایی‌های Opus 5 به رفع یک باگ واقعی در یک مدیر بسته متن‌باز محبوب مربوط می‌شود و Claude می‌گوید این مدل علاوه بر شناسایی علت اصلی مشکل، یک حالت مرزی را نیز اصلاح کرد که در وصله منتشرشده از سوی جامعه توسعه‌دهندگان نادیده گرفته شده بود. در مقابل یک مدل رقیب تنها نشانه ظاهری خطا را برطرف کرد و به اشتباه اعلام کرد مشکل به‌طور کامل حل شده است.

در نمونه‌ای دیگر یکی از مهندسان یک شرکت معاملاتی از Opus 5 برای ساخت جریان داده بازار یک صرافی جدید استفاده کرد. به گفته Claude، مدل‌های قبلی حتی با وجود دریافت برنامه‌های کاری مفصل نیز قادر به انجام این پروژه نبودند. محصول جدید کلاد علاوه بر تکمیل پروژه در یک جلسه، به دلیل نبود جریان داده زنده برای اعتبارسنجی، یک چارچوب آزمایش اختصاصی نیز ایجاد کرد تا صحت پردازش داده‌ها را بررسی کند.

نتایج بنچمارک‌ها و عملکرد Claude Opus 5:

نتایج آزمون‌های پیش از عرضه نشان می‌دهد Opus 5 هم‌راستاترین مدل Claude تا امروز است. این مدل نسبت به Opus 4.8، Sonnet 5 و Fable 5 پایبندی بیشتری به قانون اساسی Claude دارد، نرخ رفتارهای فریبکارانه در آن کمتر است، دشوارتر می‌توان آن را برای سوءاستفاده فریب داد و همچنین در انجام اقداماتی که ممکن است پیامدهای سخت‌برگشت داشته باشند، محتاط‌تر از مدل‌های پیشین عمل می‌کند.

کلاد تأکید می‌کند Opus 5 مرز قابلیت‌های پرخطر و دومنظوره را جابه‌جا نکرده و ارزیابی‌هایی که با همکاری نهادهای دولتی و شرکای بخش خصوصی انجام شده‌اند نشان می‌دهند این مدل همچنان در پژوهش‌های زیستی و امنیت سایبری تهاجمی از Mythos 5 ضعیف‌تر است. جزئیات کامل این بررسی‌ها نیز در سند System Card منتشر شده و شرکت برای شفافیت بیشتر به آن ارجاع داده است.

همانند Opus 4.8، این شرکت مدل جدید را نیز به‌صورت اختصاصی برای وظایف امنیت سایبری آموزش نداده است. با این حال افزایش توانایی‌های عمومی باعث شده Opus 5 در شناسایی آسیب‌پذیری‌های امنیتی پیشرفت چشمگیری داشته باشد و به Mythos 5 نزدیک شود. با وجود این در بهره‌برداری از آسیب‌پذیری‌ها و تبدیل آن‌ها به تهدیدهای واقعی سایبری همچنان فاصله قابل‌توجهی با Mythos 5 دارد.

این تفاوت در ارزیابی OSS-Fuzz نیز دیده می‌شود؛ معیاری که توانایی مدل‌ها را در یافتن آسیب‌پذیری‌ها و سپس بهره‌برداری از آن‌ها بدون راهنمایی گسترده انسانی می‌سنجد. بر اساس نتایج کلاد، Opus 5 و Mythos 5 در شناسایی آسیب‌پذیری‌ها عملکردی نزدیک به یکدیگر دارند، اما Opus 5 در توسعه اکسپلویت‌ها فاصله قابل‌توجهی با رقیب خود دارد.

کلاد اعلام می‌کند سازوکارهای حفاظتی اوپس۵ به‌گونه‌ای طراحی شده‌اند که استفاده‌های مفید از مدل را در حوزه‌های امنیت سایبری و زیست‌شناسی امکان‌پذیر کنند. این سازوکارها تقریباً مشابه Opus 4.8 هستند، با این تفاوت که برای گروه محدودی از وظایف امنیت سایبری، محافظت‌های سخت‌گیرانه‌تری در نظر گرفته شده است.

در بخش امنیت سایبری طبقه‌بندهای Opus5 نسبت به Fable 5 محدودیت کمتری دارند و این مدل می‌تواند آسیب‌پذیری‌ها را در کد منبع شناسایی کند، اما اسکن آسیب‌پذیری مبتنی بر فایل‌های باینری، تست نفوذ و تولید اکسپلویت را مسدود می‌کند. Claude برآورد می‌کند این طبقه‌بندها در مقایسه با Fable 5 حدود ۸۵ درصد کمتر مداخله خواهند کرد.

در سرویس‌های Claude.ai، Claude Code و Claude Cowork، درخواست‌هایی که توسط طبقه‌بندهای ایمنی Opus 5 علامت‌گذاری شوند، به‌صورت پیش‌فرض به Opus 4.8 ارجاع داده خواهند شد و این قابلیت در API نیز قابل فعال‌سازی است. همچنین اعضای برنامه Cyber Verification Program (CVP) از همین حالا به نسخه‌ای از Opus 5 با محدودیت‌های امنیتی کمتر دسترسی دارند.

در حوزه زیست‌شناسی نیز Opus 5 با وجود بهره‌گیری از سازوکارهای حفاظتی مشابه Opus 4.8، اکنون توانمندترین مدل عمومی Claude برای پژوهش‌های علمی محسوب می‌شود. با این حال، شرکت تأکید می‌کند این مدل همچنان در انجام پژوهش‌های خودکار و بلندمدت محدودیت‌های مهمی دارد و Mythos 5 برای چنین وظایفی گزینه قدرتمندتری باقی مانده است.

هم‌زمان با عرضه Opus 5، درخواست‌های مرتبط با زیست‌شناسی که در Fable 5 توسط سامانه‌های ایمنی مسدود شوند، از این پس به‌جای Opus 4.8 به Opus 5 هدایت خواهند شد. این مدل از امروز با قیمت ۵ دلار به‌ازای هر یک میلیون توکن ورودی و ۲۵ دلار به‌ازای هر یک میلیون توکن خروجی، برابر با Opus 4.8، روی همه پلتفرم‌ها در دسترس قرار گرفته است.

Opus 5 علاوه بر حالت عادی، در Fast Mode نیز عرضه می‌شود؛ حالتی که طبق اعلام Claude حدود ۲.۵ برابر سریع‌تر از نسخه پیش‌فرض اجرا می‌شود. همانند Opus 4.8، استفاده از Fast Mode در Claude Platform با دو برابر قیمت پایه Opus 5 محاسبه می‌شود و کاربران Claude Code نیز می‌توانند از طریق اعتبار مصرفی به آن دسترسی داشته باشند.

Claude هم‌زمان با معرفی Opus 5، دو قابلیت آزمایشی جدید را نیز در اختیار توسعه‌دهندگان قرار داده است که در نخست امکان تغییر ابزارهای قابل استفاده Claude در میانه یک گفت‌وگو در Claude Platform بدون آنکه کش پرامپت از اعتبار خارج شود می‌دهد. دوم، قابلیت Automatic Fallbacks در API که درخواست‌های علامت‌گذاری‌شده توسط سامانه‌های ایمنی Opus 5 یا Fable 5 را به‌طور خودکار به مدل دیگری هدایت می‌کند.

به گفته Claude با فعال بودن قابلیت Automatic Fallbacks، درخواست‌های API به‌جای مسدود شدن، به‌صورت پیش‌فرض همیشه به بهترین مدل دردسترس هدایت می‌شوند. این شرکت همچنین اعلام کرده است Opus 5 مانند نسل‌های پیشین خانواده Opus، برای استفاده عمومی هیچ الزام مربوط به نگهداری داده‌ها ندارد و توسعه‌دهندگان می‌توانند از طریق Claude API کار با مدل claude-opus-5 را آغاز کنند.

منبع

ابوالفضل | ۱ ساعت پیش

دیدگاهتان را بنویسید