CoreTech

Anthropic Claude Opus 5.5

کلاد Opus 5.5 معرفی شد؛ مدل جدید Anthropic با هزینه ۴۰ درصد کمتر و برابر با Fable 5.1

ابوالفضل | ۱ روز پیش

آنتروپیک نخستین عضو خانواده Claude 5.5 را با نام Claude Opus 5.5 معرفی کرد؛ مدلی که به گفته شرکت در بیشتر کارها به سطح Claude Fable 5.1 می‌رسد، اما هزینه اجرای آن حدود ۴۰ درصد کمتر از Opus 5 است. Opus 5.5 همچنین در جامع‌ترین ارزیابی رفتاری خودکار Anthropic، بهترین عملکرد ثبت‌شده میان مدل‌های آزمایش‌شده این شرکت را به دست آورده است.

این مدل پیش از عرضه توسط ارزیابانی مانند METR و Frontier Design نیز بررسی شده است و آنتروپیک می‌گوید Opus 5.5 در برنامه‌نویسی عامل‌محور، استفاده از رایانه و کارهای دانش‌محور پیشرفت کرده و یک آزمایش‌کننده مهاجرت کدی ۶۸۰ هزار خطی را در کمتر از یک روز انجام داده است؛ کاری که می‌توانست چند هفته زمان یک تیم مهندسی را نیاز داشته باشد.

اوپوس ۵.۵ یک کدبیس ۲۰۰ هزار خطی را در کمتر از سه ساعت ممیزی و اصلاح کرد، در حالی که Opus 5 بیش از ۲۰ ساعت زمان برد و ۲.۵ برابر توکن بیشتری مصرف کرد. مدل جدید همچنین در کاهش زمان بارگذاری صفحات یک اپلیکیشن وب، در ۳۹ مورد از ۴۰ تلاش موفق شد. Opus 5 بهبودهای کوچک‌تری ایجاد کرد که گاهی رفتار اپلیکیشن را نیز تغییر می‌داد.

در آزمایشی دیگر، چند مدل Claude مأمور ساخت یک بازی از یک دستور واحد شدند و Opus 5.5 از نظر گرافیک بالاترین امتیاز را گرفت. هزینه استفاده از مدل جدید نیز کاهش یافته است و قیمت ورودی برای هر یک میلیون توکن ۴ دلار و خروجی ۲۰ دلار است؛ هر دو رقم ۲۰ درصد کمتر از Opus 5 هستند. هزینه Cache Read نیز به ۰.۲ دلار برای هر یک میلیون توکن رسیده است.

Cache Read نسبت به Opus 5 حدود ۶۰ درصد ارزان‌تر شده و برای کارهای عامل‌محور و برنامه‌نویسی اهمیت دارد. Anthropic می‌گوید Opus 5.5 بیش از ۳۰ درصد سریع‌تر از نسل قبل خروجی تولید می‌کند. حالت Fast نیز در Claude Code و Claude Platform با سرعتی تا ۲.۵ برابر ارائه می‌شود و قیمت آن برای هر یک میلیون توکن ورودی ۸ دلار و برای خروجی ۴۰ دلار است.

آنتروپیک محدودیت‌های استفاده پنج‌ساعته در طرح‌های پرو، مکس و Team را افزایش می‌دهد و به کاربران اشتراکی اجازه می‌دهد یک Rate Limit Reset را ذخیره کنند. در آزمایش ترجمه HAProxy از C به Rust، اوپوس ۵.۵ و Fable 5.1 تقریباً تمام آزمون‌های رگرسیون را پشت سر گذاشتند؛ با این حال، مدل جدید کار را در ۹.۵ ساعت تمام کرد و هزینه اجرای آن ۵۱ درصد کمتر بود.

در FrontierCode، آنتروپیک می‌گوید Opus 5.5 با سطح تلاش پیش‌فرض، GPT-6 Astra را با حدود یک‌پنجم هزینه هر وظیفه پشت سر می‌گذارد. در Terminal-Bench 4.0 نیز با حدود ۴۰ درصد هزینه آسترا به عملکرد مشابه می‌رسد و در CursorBench با اختلاف ۱۱ امتیاز از GPT-5.6 Sol بالاتر قرار می‌گیرد. با این حال، Anthropic تأکید می‌کند فاصله بنچمارکی همیشه تفاوت واقعی مدل‌ها را نشان نمی‌دهد.

آنتروپیک می‌گوید در استفاده داخلی، فاصله Opus 5.5 و Fable 5.1 کمتر از چیزی بوده که برخی امتیازهای بنچمارکی نشان می‌دهند. نتایج مدل، مگر در موارد خلاف آن، با Adaptive Thinking و بیشترین سطح تلاش محاسباتی به دست آمده‌اند. در Terminal-Bench 4.0، Opus 5.5 با سطح xhigh و GPT-6 Astra با سطح high ارزیابی شده‌اند و تدابیر ایمنی تولید نیز هنگام آزمون فعال بوده‌اند.

آزمون مهم Opus 5.5 با تدابیر ایمنی تولید فعال انجام شده است و هرجا این تدابیر مداخله کرده‌اند، وظایف امنیت سایبری به Opus 4.8 و وظایف زیست‌شناسی و توسعه مدل‌های مرزی نیز به Opus 5 واگذار شده‌اند؛ Anthropic می‌گوید این موضوع احتمالاً عملکرد ثبت‌شده Opus 5.5 را کاهش داده است و خطای استاندارد آن در Terminal-Bench 4.0 برابر ۲.۶ امتیاز بوده است.

برای دیگر مدل‌های Claude در Terminal-Bench 4.0، خطای استاندارد بین ۱.۶ تا ۲ امتیاز بوده است. جدول عمومی با پنج اجرای هر وظیفه، Opus 5 را ۵۱.۸ درصد ثبت کرده و اجرای Anthropic به ۵۲.۳ درصد رسیده که در محدوده خطا قرار دارد. در AutomationBench، نتایج Opus 5.5 توسط Zapier و بدون مدل جایگزین به دست آمده‌اند و مداخلات ایمنی شکست محسوب شده‌اند.

بنچمارک‌ها و رتبه‌بندی Claude Opus 5.5 در برابر رقبای مطرح:

در Terminal-Bench-Science 0.1، خطای استاندارد مدل‌ها بین ۳.۵ تا ۵ امتیاز بوده است. جدول عمومی Opus 5 را ۳۰ درصد ثبت کرده، در حالی که اجرای Anthropic به ۲۹ درصد رسیده است؛ عدد GPT-6 Astra از گزارش OpenAI گرفته شده. در یک ارزیابی پژوهشی، ۱۶ مورد از ۱۸ گزارش Opus 5.5 استاندارد کیفی را پشت سر گذاشتند، در حالی که هیچ تلاش Fable 5.1 یا Opus 5 به این معیار نرسید.

در آن ارزیابی، مدل‌ها باید گزارش عملکرد فصلی یک شرکت را فقط با استفاده از نسخه‌ای از وب تهیه می‌کردند که یافتن گزارش درآمدی در آن دشوار بود. ارزیاب خودکار همه ارقام و نقل‌قول‌ها را با منابع تطبیق داد و وجود هر مورد ساختگی باعث ردشدن گزارش می‌شد. در تحلیل مالی نیز Walleye Capital گفت Opus 5.5 در پایین‌ترین سطح تلاش تقریباً مجموعه ارزیابی آن را حل کرد.

Walleye Capital همچنین گزارش کرد که Opus 5.5 در سطوح بالاتر، خطایی را در دستورالعمل ارزیابی تشخیص داد و اصلاح کرد؛ طبق گزارش شرکت، هیچ مدل دیگری پیش‌تر آن را پیدا نکرده بود. در آزمایش ادغام فرضی دو شرکت نرم‌افزار منابع انسانی نیز هر دو مدل به نتیجه یکسانی رسیدند، اما مدل مالی Opus 5.5 کامل‌تر و ارائه آن خواناتر بود و هزینه تولید خروجی حدود ۵۰ درصد کمتر شد.

Opus 5.5 در همان آزمایش ادغام، کار را در ۶۳ دقیقه انجام داد و Opus 5 به ۹۳ دقیقه زمان نیاز داشت؛ در خروجی مدل قدیمی خطاهای جزئی نیز دیده شد. در GDPval-AA v2.1، آزمونی برای عملکرد واقعی در ۴۴ شغل، Opus 5.5 امتیاز ۱۸۴۶ Elo به دست آورده است. Anthropic همچنین می‌گوید در آزمون‌های گردش‌کار تجاری و جمع‌آوری داده در مقیاس بزرگ، نتایج بهتری ثبت کرده است.

در سطح تلاش پیش‌فرض مدیوم، Anthropic می‌گوید Opus 5.5 در برابر GPT-6 Astra با بیشترین تلاش، عملکرد بالاتر و هزینه‌ای حدود یک‌پنجم برای هر وظیفه داشته است. سبک ارتباطی مدل نیز تغییر کرده و نوشته‌ها واضح‌ترند، اطلاعات مهم زودتر می‌آیند، اصطلاحات نامتعارف کمتر و پیروی از دستورهای نوشتاری بهتر است. این تغییرات بررسی خروجی در جلسات طولانی را ساده‌تر می‌کنند.

در بخش ایمنی، Opus 5.5 در برابر Prompt Injection در برنامه‌نویسی، استفاده از ابزارها، کار با رایانه و وب‌گردی با Opus 5 برابری کرده یا بهتر بوده است. در آزمون Gray Swan نیز همراه با Fable 5.1 کمترین نرخ موفقیت حملات را میان مدل‌ها ثبت کرد. ارزیابی رفتاری Anthropic نزدیک به ۲ هزار سناریو را پوشش می‌دهد و مدل جدید در معیارهای رفتار ناسازگار بهتر از مدل‌های اخیر Claude بوده است.

در ارزیابی عبور از مرزهای محصورسازی، Opus 5.5 حدود ۸۵ درصد کمتر از Opus 5 یا Claude Mythos 5.1 برای دورزدن محدودیت‌ها تلاش کرد و همه تلاش‌ها شدت پایینی داشتند و خود مدل آن‌ها را گزارش کرد. با این حال، Anthropic می‌گوید آزمون‌هایی که بتوانند همه شکست‌های احتمالی را پیش از عرضه شناسایی کنند هنوز وجود ندارند و Opus 5.5 گاهی متوجه ارزیابی‌شدن خود می‌شود.

اوپوس ۵.۵ در زیست‌شناسی از Opus 5 توانمندتر است و در بسیاری زمینه‌ها با Claude Mythos 5.1 برابری یا بهتر عمل می‌کند. در ارزیابی طراحی مولکولی با Dyno Therapeutics بهبودهایی ثبت شد و ارزیابان متخصص نوآوری علمی آن را هم‌سطح بهترین مدل آزمایش‌شده دانستند. به همین دلیل، تدابیر زیستی Fable 5.1 برای آن اعمال شده و نهادها می‌توانند برای Life Sciences Verification Program درخواست دهند.

وظایف تخصصی امنیت سایبری به Opus 4.8 ارجاع داده می‌شوند و Cyber Verification Program به‌زودی Opus 5.5 را پوشش می‌دهد. Anthropic تدابیر ضد Distillation را فعال کرده است. قابلیت Preserved Thinking برای حساب‌های API ایجادشده از ۳۱ اوت ۲۰۲۶ اعمال می‌شود و مانع ویرایش زمینه قبلی Claude برای استخراج استدلال خواهد شد. مدل با Zero Data Retention و Watermarking نیز ارائه می‌شود و با Thinking خاموش در دسترس نیست.

اوپوس ۵.۵ اکنون در Amazon Web Services، Google Cloud، Microsoft Azure و Claude Platform با شناسه claude-opus-5-5 در دسترس است. عرضه آن نخستین انتشار Anthropic پس از درخواست Dario Amodei برای Pace کردن پیشرفت مرزی هوش مصنوعی محسوب می‌شود. شرکت می‌گوید هدف این رویکرد، همگام‌کردن ایمنی با رشد توانایی مدل‌ها، حفظ رقابت با چین و بهره‌گیری از مزایای هوش مصنوعی، به‌ویژه در زیست‌شناسی و پزشکی است.

برای مدل‌های فعلی، Anthropic به ارزیابی هم‌ترازی، آزمون‌های پیش از عرضه توسط METR و Frontier Design و تدابیر ویژه در حوزه‌های پرخطر تکیه دارد. برای مدل‌های آینده نیز فیلتر محیط‌های Reinforcement Learning را سخت‌گیرانه‌تر می‌کند، پاداش‌های هم‌ترازی و سناریوهای آموزشی متنوع را بهبود می‌دهد و روی امنیت و نظارت مبتنی بر تفسیرپذیری کار می‌کند. این شرکت همچنین Responsible Scaling Policy را برای گزارش خطرهای مدل‌های پیشرفته به کار می‌گیرد.

آنتروپیک معتقد است مدل‌هایی که بتوانند پژوهش هوش مصنوعی را کاملاً خودکار کنند، به استاندارد ایمنی بیشتری نیاز دارند و اقدامات فعلی برای این سطح کافی نیستند. این شرکت بر نقش بیشتر سیاست‌گذاری عمومی در ایمنی سیستم‌ها تأکید کرده و زیرساخت همکاری با دولت آمریکا و صنعت برای تنظیم‌گری را توسعه می‌دهد. Claude Sonnet 5.5 و Claude Haiku 5.5 نیز هفته‌های آینده عرضه می‌شوند و پیشرفت‌های Opus 5.5 را دنبال می‌کنند.

منبع ۱ | منبع ۲

ابوالفضل | ۱ روز پیش

دیدگاهتان را بنویسید