CoreTech

Claude Sonnet 5.5

آنتروپیک از Claude Sonnet 5.5 با جهش بزرگ در عملکرد و سرعت رونمایی کرد

ابوالفضل | ۱۷ ساعت پیش

آنتروپیک مدل Claude Sonnet 5.5 را معرفی کرده است؛ مدلی که نسبت به Sonnet 5 بیش از ۳۰ درصد سریع‌تر است و به‌دلیل مصرف توکن کمتر، در بسیاری از وظایف تا ۳۰ درصد هزینه پایین‌تری دارد. این مدل دومین عضو خانواده Claude 5.5 محسوب می‌شود و برای کارهای روزمره، رفع باگ، تولید اسناد، ارائه‌ها و فایل‌های جدولی طراحی شده است، در حالی که Opus 5.5 برای کارهای پیچیده‌تر باقی می‌ماند.

Sonnet 5.5 از نظر عملکرد جهش قابل‌توجهی دارد و در ارزیابی کدنویسی عامل‌محور Terminal-Bench 4.0 به امتیاز ۷۰.۶ درصد رسیده، در حالی که Sonnet 5 امتیاز ۱۰.۳ درصد داشته است. همچنین در آزمون GDPval-AA که توانایی انجام کارهای واقعی در مشاغل مختلف را می‌سنجد، تنها دو امتیاز با Opus 5.5 فاصله دارد. Anthropic می‌گوید Sonnet جدید در کارهای طولانی‌مدت و درک تصویر نیز قدرتمند است.

یکی از نشانه‌های پیشرفت این مدل، عملکرد آن در بازی Pokémon Red است؛ Sonnet 5.5 نخستین مدل Sonnet محسوب می‌شود که توانسته تنها با تکیه بر اسکرین‌شات‌ها از این آزمون عبور کند. در چند ارزیابی دیگر نیز نسخه Sonnet 5.5 با سطح تلاش Max به عملکردی نزدیک به Opus 5.5 رسیده است. با این حال، Anthropic تأکید می‌کند که امتیازهای بنچمارک فقط بخشی از توانایی مدل را نشان می‌دهند.

بررسی‌های داخلی و آزمایش‌های انجام‌شده توسط ارزیابان خارجی نشان می‌دهد Opus 5.5 همچنان در کارهای پیچیده و باز که به قضاوت مستمر نیاز دارند، به‌وضوح قوی‌تر است. Sonnet 5.5 بیشتر برای وظایف مشخص و روزمره ساخته شده و سرعت بالاتر آن امکان رفت‌وبرگشت سریع‌تر در فرایند کار را فراهم می‌کند. این مدل همچنین در زمینه طراحی توجه بیشتری به جزئیات بصری دارد و رابط‌های کاربری و ارائه‌ها را با پرداخت نهایی بهتری تولید می‌کند.

آنتروپیک قیمت اسمی Sonnet 5.5 را نسبت به نسل قبلی تغییر نداده است و هزینه این مدل برای هر یک میلیون توکن ورودی ۲ دلار، برای هر یک میلیون توکن خروجی ۱۰ دلار و برای هر یک میلیون توکن خواندن از حافظه کش ۲۰ سنت است. با این حال، Sonnet 5.5 برای انجام یک کار مشابه معمولاً توکن‌های بسیار کمتری مصرف می‌کند و در آزمایش‌های Anthropic هزینه هر وظیفه تا ۳۰ درصد کمتر شده است.

سرعت تولید خروجی نیز بیش از ۳۰ درصد افزایش یافته و Sonnet 5.5 را به سریع‌ترین مدل Sonnet تا امروز تبدیل کرده است. کاربر می‌تواند با تغییر سطح تلاش، میان سرعت، هزینه و کیفیت تعادل برقرار کند. در Claude Code و برنامه‌های Claude، سطح پیش‌فرض تلاش Medium است، در حالی که Claude Platform به‌صورت پیش‌فرض از High استفاده می‌کند. سطوح پایین‌تر پاسخ سریع‌تر و مصرف کمتر توکن دارند و سطوح بالاتر بررسی دقیق‌تری انجام می‌دهند.

در حوزه برنامه‌نویسی، جهش عملکرد Sonnet 5.5 بیشتر به چشم می‌آید. این مدل در سطح تلاش High آزمون FrontierCode حدود ۱۰ امتیاز بالاتر از Sonnet 5 در همان سطح گرفته و هزینه هر وظیفه آن حدود یک‌پانزدهم بوده است. در CursorBench که وظایف برگرفته از نشست‌های واقعی برنامه‌نویسی در Cursor را بررسی می‌کند، بهترین امتیاز Sonnet 5.5 تنها حدود دو امتیاز با Opus 5.5 فاصله دارد.

آزمایش‌کنندگان اولیه گفته‌اند Sonnet 5.5 می‌تواند یک کدبیس را سریع‌تر درک کند و در اجرای ابزارها نیز کارآمدتر است. در مقایسه مستقیم، این مدل تماس‌های ابزار را بیشتر به‌صورت دسته‌ای انجام داده و در نتیجه برای رسیدن به نتیجه به مراحل کمتری نیاز داشته است. این رفتار علاوه بر کوتاه‌تر کردن فرایند کار، هزینه اجرای وظایف را نیز کاهش می‌دهد و یکی از دلایل عملی پایین‌تر بودن هزینه کلی مدل است.

در حوزه دانش نیز Sonnet 5.5 پیشرفت کرده و در GDPval-AA، که وظایف واقعی مربوط به ۴۴ شغل در ۹ صنعت اصلی را ارزیابی می‌کند، این مدل تقریباً هم‌سطح Opus 5.5 قرار گرفته و حدود ۴۰۰ امتیاز بالاتر از Sonnet 5 عمل کرده است. Sonnet 5.5 در استفاده از رایانه و تشخیص نمودار نیز به Opus 5.5 نزدیک است و در کارهای دانش‌محور طولانی‌مدت نیز از Sonnet 5 و GPT-6 Sol بهتر عمل کرده است.

تسترهای اولیه علاوه بر امتیازهای عددی، تغییرات کیفی را نیز گزارش کرده‌اند. آن‌ها Sonnet 5.5 را در گفت‌وگو طبیعی‌تر و برای همکاری مناسب‌تر دانسته‌اند و به توانایی آن در طراحی اشاره کرده‌اند. این مدل می‌تواند رابط‌های کاربری را با پرداخت بیشتری تولید کند و قالب اسلایدها را دنبال کند تا ارائه‌هایی بسازد که به ویرایش کمی نیاز داشته باشند. در یک آزمایش داخلی، نخستین پیش‌نویس یک ارائه ۱۰ اسلایدی آماده ارسال ارزیابی شد.

در آن آزمایش، به مدل گزارش‌های مالی فصلی و متن تماس‌های درآمدی یک شرکت سهامی عام، به‌همراه قالب مشخص اسلاید، داده شد و از آن خواسته شد یک مرور عملیاتی ۱۰ اسلایدی آماده کند. دو متخصص خروجی نخست را بدون نیاز به ویرایش بیشتر، آماده ارسال دانستند. Anthropic این نتیجه را در کنار بهبودهای کمی مدل مطرح می‌کند، اما هم‌زمان تأکید دارد که ارزیابی‌های بنچمارکی به‌تنهایی نماینده تمام قابلیت‌های یک مدل نیستند.

کاهش مصرف توکن در Sonnet 5.5 به‌طور مستقیم روی هزینه اجرای وظایف اثر می‌گذارد. در تنظیمات تلاش پایین یا متوسط، این مدل در چند بنچمارک توانسته بهترین امتیاز Sonnet 5 را با حدود یک‌دهم هزینه هر وظیفه پشت سر بگذارد. از طرف دیگر، در سطح‌های بالاتر تلاش، عملکرد آن می‌تواند با Opus 5.5 قابل‌مقایسه باشد و هزینه‌ای مشابه داشته باشد. بنابراین انتخاب سطح تلاش، بخش مهمی از کنترل هزینه و کیفیت خواهد بود.

بنچمارک‌های رسمی Claude Sonnet 5.5 و مقایسه با چند مدل دیگر:

آنتروپیک برای Sonnet 5.5 ارزیابی ایمنی و هم‌راستایی گسترده‌ای انجام داده و این ارزیابی حدود ۱۸۵۰ سناریو را پوشش می‌دهد و رفتار مدل در زمینه‌هایی مانند اقدام برخلاف منافع کاربر، گمراه‌کردن کاربران و همکاری در سوءاستفاده‌های پرخطر را بررسی می‌کند. Sonnet 5.5 در بیشتر معیارهای هم‌راستایی، مقاومت در برابر سوءاستفاده و صداقت، نسبت به Sonnet 5 بهتر یا هم‌سطح بوده است.

در ارزیابی‌های جدید مربوط به مهارپذیری نیز Sonnet 5.5 به Opus 5.5 نزدیک شده است. این مدل در میان مدل‌های آزمایش‌شده کمترین تمایل را برای بررسی مرزهای محیط‌های محصور و از جمله کمترین تمایل به تلاش برای خروج از سندباکس نشان داده است. در مجموع، Opus 5.5 همچنان عملکرد اندکی بهتر در ارزیابی کامل داشته، اما Anthropic می‌گوید شواهدی پیدا نکرد که Sonnet 5.5 اهدافی برخلاف خواسته کاربر دنبال کند.

با وجود این نتایج، Anthropic هشدار می‌دهد هیچ مجموعه ارزیابی‌ای نمی‌تواند همه شکست‌های احتمالی را شناسایی کند و ممکن است گرایش‌هایی در Sonnet 5.5 وجود داشته باشد که هنوز کشف نشده‌اند. به همین دلیل، این شرکت ارزیابی‌های داخلی خود را با سازوکارهای ایمنی تکمیل کرده است. این رویکرد بخشی از چارچوب ارزیابی هم‌راستایی Anthropic است و صرفاً به نتایج آزمون‌های رفتاری محدود نمی‌شود.

قابلیت‌های امنیت سایبری Sonnet 5.5 نسبت به Sonnet 5 به‌طور چشمگیری افزایش یافته و به همین دلیل Anthropic برای آن سازوکارهای حفاظتی مشابه Opus 5.5 در نظر گرفته است. کاربران همچنان می‌توانند برای توسعه عادی نرم‌افزار، باگ‌های کد خود را پیدا و اصلاح کنند، اما وظایف امنیت سایبری پرخطر به‌صورت قابل مشاهده به Sonnet 5 منتقل خواهند شد. این شرکت همچنین برنامه Cyber Verification Program را برای دسترسی سطح‌بندی‌شده به قابلیت‌های پیشرفته‌تر گسترش می‌دهد.

در حوزه زیست‌شناسی، Sonnet 5.5 همان مجموعه حفاظتی Sonnet 5 را حفظ کرده است. این محدودیت‌ها درخواست‌های آسیب‌زا را هدف می‌گیرند و طبق توضیح Anthropic، بیشتر فعالیت‌های پژوهشی، آموزشی و بالینی را تحت تأثیر قرار نمی‌دهند؛ با این حال برخی درخواست‌های مربوط به میکروبیولوژی و ویروس‌شناسی ممکن است اشتباهاً علامت‌گذاری شوند. سازمان‌ها می‌توانند برای دسترسی به سازوکارهای مناسب‌تر برای طیف کامل فعالیت‌های زیست‌شناسی، در Life Sciences Verification Program درخواست دهند.

آنتروپیک همچنین برای مقابله با حملات تقطیر، یعنی استفاده از هزاران حساب جعلی برای استخراج قابلیت‌های مدل در مقیاس صنعتی، حفاظت جدیدی اضافه کرده است. Sonnet 5.5 نخستین مدل Sonnet است که با طبقه‌بندی‌کننده‌های ایمنی جلوگیری‌کننده از استخراج فرایند استدلال عرضه می‌شود. این مدل همچنین قابلیت preserved thinking را گسترش می‌دهد تا فرایند فکرکردن Claude از حسابی که آن را ایجاد کرده جدا نشود؛ بیشتر توسعه‌دهندگان تغییر محسوسی نخواهند دید.

در نتیجه این تغییر، جابه‌جایی مکالمه میان حساب‌ها، از جمله تغییر حساب در میانه یک نشست Claude Code، مشمول محدودیت‌های جدید خواهد بود و Anthropic برای آن راهنمای مهاجرت ارائه کرده است. Sonnet 5.5 مانند Opus 5.5 و Sonnet 5 با گزینه نگهداری صفر داده در دسترس است. این مدل اکنون روی تمام پلتفرم‌های ارائه‌شده توسط Anthropic، از جمله Amazon Web Services، Google Cloud و Microsoft Azure، قابل استفاده است.

توسعه‌دهندگان می‌توانند Sonnet 5.5 را در Claude Platform با شناسه claude-sonnet-5-5 استفاده کنند. در صورتی که Sonnet با قابلیت thinking خاموش اجرا شود، برای مهاجرت به نسخه جدید باید به تنظیم between_tools منتقل شوند؛ این تنظیم تفکر اولیه را خاموش نگه می‌دارد. Anthropic در راهنمای مهاجرت خود جزئیات تغییرات مربوط به این حالت را توضیح داده است. Haiku 5.5 نیز به‌عنوان عضو بعدی خانواده Claude 5.5 در هفته‌های آینده عرضه خواهد شد.

منبع

ابوالفضل | ۱۷ ساعت پیش

دیدگاهتان را بنویسید