CoreTech

Z.ai GLM-5.3 open source model

مدل جدید GLM-5.3 رونمایی شد؛ جهش کدنویسی و ظهور قابلیت‌های سایبری غیرمنتظره

ابوالفضل | ۳ ساعت پیش

شرکت Z.ai از GLM-5.3 رونمایی کرد؛ مدلی که بدون تغییر مدل پایه GLM-5.2 و تنها با گسترش آموزش پس از پیش‌آموزش توسعه یافته است. تمرکز نسخه جدید روی کدنویسی پیچیده و وظایف عامل‌محور طولانی‌مدت است، اما مهم‌ترین نکته معرفی آن به قابلیت‌های امنیت سایبری بازمی‌گردد. Z.ai می‌گوید این توانایی‌ها در جریان افزایش مقیاس آموزش سریع‌تر از انتظار رشد کرده‌اند و مدل در مراحل مختلف بهره‌برداری از آسیب‌پذیری‌ها نیز توانمندتر شده است.

شرکت چینی Z.ai ادعا می‌کند GLM-5.3 توانمندترین مدل دارای وزن‌های باز برای کدنویسی است و در معیار داخلی Z.ai Code Bench حدود ۵۰ درصد نسبت به GLM-5.2 پیشرفت کرده است. این شرکت همچنین می‌گوید مدل جدید در معیارهای عمومی Terminal-Bench 3.0 و Agents’ Last Exam به بهترین عملکرد میان مدل‌های متن‌باز رسیده است. تمام این دستاوردها، طبق اعلام Z.ai، از مرحله پساآموزش حاصل شده و مدل پایه همان نسخه قبلی باقی مانده است.

در مقایسه مستقیم با GLM-5.2، امتیاز GLM-5.3 در Terminal-Bench 3.0 از ۴.۶ به ۲۸.۳ رسیده است. در DeepSWE v1.1 نیز امتیاز دو نسل از ۴۶.۲ به ۶۶.۹ افزایش یافته و در Agents’ Last Exam از ۲۳.۸ به ۲۸.۵ رسیده است. این نتایج نشان می‌دهند بیشترین اثر افزایش مقیاس آموزش در وظایف طولانی‌مدت و پیچیده ظاهر شده است، نه صرفاً در تمرین‌های کوتاه کدنویسی.

Z.ai برای سنجش نزدیک‌تر به کاربرد واقعی، معیار خصوصی Z.ai Code Bench را ساخته است و این آزمون عامل‌های کدنویسی را در محیط‌های توسعه محلی پیچیده و در دسته‌های متنوع وظایف بررسی می‌کند و دو شاخص نرخ تکمیل کامل وظیفه و دقت چک‌لیست را می‌سنجد. خصوصی بودن معیار نیز به گفته شرکت خطر آلودگی ناشی از مجموعه‌آزمون‌های عمومی را کاهش می‌دهد و تصویر دقیق‌تری از تجربه کاربر ارائه می‌کند.

مقایسه GLM-5.3 با دیگر مدل‌های مطرح:

در Z.ai Code Bench، مدل GLM-5.3 در سطح مکس به امتیاز ۳۴.۵ درصد با حدود ۷۵ هزار توکن خروجی برای هر وظیفه رسیده است؛ در حالی که GLM-5.2 با مصرف حدود ۹۶ هزار توکن، ۲۳.۴ درصد ثبت کرده بود. در سطح High نیز GLM-5.3 با حدود ۵۰ هزار توکن به ۳۱.۴ درصد رسید و Claude Opus 4.8 با ۱۲۰ هزار توکن، امتیاز ۲۹.۵ درصد گرفت.

با وجود این برتری، GLM-5.3 در همه مقایسه‌ها صدرنشین نیست و مثلا Claude Fable 5 در سطح Max به امتیاز ۳۹.۵ درصد می‌رسد و بالاتر از مدل جدید Z.ai قرار دارد. Z.ai تأکید دارد محیط‌های آموزشی GLM-5.3 اکنون بیشتر شبیه واحدهای واقعی کار تخصصی هستند. برخی وظایف حتی معادل چند روز کار مهندس باتجربه‌اند و مدل باید کار را از تشخیص مسئله تا اجرای راه‌حل و سنجش نتیجه پیش ببرد.

برای مثال، در یک وظیفه زیرساخت یادگیری ماشین، مدل می‌تواند به کلاسترهای محاسباتی، ذخیره‌سازی، مستندات داخلی، کدها و نتایج آزمایش دسترسی داشته باشد. عامل باید گلوگاه‌های زنجیره آموزش را پیدا کند، بهینه‌سازی انجام دهد، آزمایش اجرا کند و بدون از بین بردن صحت عملکرد، سرعت کلی را به‌طور قابل‌اندازه‌گیری افزایش دهد. Z.ai برای تولید چنین محیط‌هایی از عامل‌های پژوهشی، داورهای خودکار و راستی‌آزماهای تولیدشده استفاده می‌کند.

راستی‌آزماها بدون دسترسی به راه‌حل مرجع ساخته می‌شوند و مسیرهای اجرای حل‌کننده برای کشف میان‌برهای پاداش به کار می‌روند. راستی‌آزمایی که آزمون‌های oracle، no-op و unsolved-state را پشت سر بگذارد، می‌تواند پاداش دودویی قابل‌اعتمادی تولید کند. با این حال، Z.ai می‌گوید این خطوط پردازشی همچنان به میزان قابل‌توجهی دخالت انسانی نیاز دارند. GLM-5.3 همچنین راهبرد SAO همراه با compaction را از GLM-5.2 به ارث برده است.

دومین محور مهم معرفی GLM-5.3، قابلیت امنیت سایبری آن است که Z.ai داده‌ها و محیط‌های کشف آسیب‌پذیری را وارد فرایند پساآموزش کرد و انتظار داشت مدل در شناسایی نقص‌های منفرد بهتر شود. با افزایش مقیاس، اما رفتار مدل فراتر رفت و توانست درباره چند مرحله بهره‌برداری استدلال کند. شرکت می‌گوید مدل شروع به ساخت برنامه‌های منسجم برای زنجیره‌های کامل بهره‌برداری کرد؛ قابلیتی که رشد آن سریع‌تر از انتظار بود.

در CyberGym، که کشف و اعتبارسنجی آسیب‌پذیری را از روی کد منبع white-box می‌سنجد، GLM-5.3 به امتیاز ۸۴.۵ درصد رسیده است؛ در حالی که GLM-5.2 امتیاز ۷۷.۲ درصد داشت. این نتیجه از Mythos 5 با ۸۳.۸ درصد و GPT-5.6 Sol با ۸۳.۶ درصد نیز بالاتر است. در ExploitBench، GLM-5.3 به ۵۴.۴ درصد رسیده و بیش از دو برابر امتیاز ۲۴.۴ درصدی نسل قبلی را ثبت کرده است.

در ExploitBench، با وجود رشد چشمگیر GLM-5.3، کلاد Mythos 5 با ۷۸ درصد و GPT-5.6 Sol با ۷۶.۵ درصد همچنان بالاتر هستند. در ExploitGym نیز مدل جدید طی دو ساعت ۱۰۵ وظیفه و طی شش ساعت ۱۳۰ وظیفه را تکمیل کرده است؛ اعداد GLM-5.2 در همین بازه‌ها ۲۹ و ۳۹ وظیفه بودند. Mythos 5 با ۱۸۱ و ۲۴۷ وظیفه همچنان فاصله محسوسی با GLM-5.3 دارد.

الگوی هر سه آزمون از نگاه Z.ai یکسان است: هرچه معیار به مراحل بالاتری از زنجیره بهره‌برداری نزدیک می‌شود، رشد GLM-5.3 نسبت به GLM-5.2 بیشتر است؛ در عین حال فاصله با مدل‌های بسته پیشرو نیز افزایش پیدا می‌کند. شرکت برای بررسی انتقال این قابلیت به دنیای واقعی، همراه چند تیم امنیتی در چین مدل‌ها را روی کدهای واقعی آزمایش کرده و پس از بررسی متخصصان، غربالگری و حذف موارد تکراری، یافته‌ها را ثبت کرده است.

طبق اعلام Z.ai، این فرایند در مجموع به شناسایی ۲۴۳۶ آسیب‌پذیری در ۲۶۹ پروژه منجر شده که ۱۰۹۷ مورد از آن‌ها شدت متوسط تا بالا داشته‌اند. یافته‌ها سیستم‌کرنل‌ها، سیستم‌عامل‌ها، موتورهای مرورگر، زیرساخت‌های متن‌باز، برنامه‌های وب و پروتکل‌های شبکه را پوشش می‌دهند. بسیاری از این مشکلات سال‌ها یا حتی دهه‌ها شناسایی نشده بودند و قدیمی‌ترین مورد، به گفته شرکت، حدود ۴۰ سال در کد باقی مانده بود.

Z.ai این فعالیت را به یک برنامه مستمر افشا تبدیل کرده و برای آن Z.ai Security Disclosure Ledger را ساخته است. این دفترکل با بررسی و انتشار یافته‌های جدید به‌روزرسانی می‌شود و میان مواردی که عمومی شده‌اند و آسیب‌پذیری‌های در حال افشا تفاوت می‌گذارد. برای موارد منتشرشده، اطلاعاتی مانند پروژه آسیب‌دیده، شدت، CVE در صورت وجود و مدت باقی ماندن آسیب‌پذیری در کد ثبت می‌شود تا روند افشا قابل پیگیری باشد.

در زیرساخت آموزش، همه این فرایندها روی slime اجرا می‌شوند؛ چارچوب متن‌باز Z.ai برای افزایش مقیاس RL پساآموزشی که Megatron را در بخش آموزش و SGLang را در rollout به کار می‌گیرد. طراحی slime آموزش، rollout و بافر داده را در یک جریان قرار می‌دهد تا ریاضیات، کد، sandboxها، راستی‌آزماها و محیط‌های عامل‌محور به‌عنوان داده تولیدشده وارد شوند و برای افزودن محیط‌های تازه نیازی به بازسازی حلقه آموزش نباشد.

Z.ai در slime قابلیت‌هایی مانند top-p mask، top-k و full-vocabulary OPD را اضافه کرده و تنظیمات R3-style و هم‌ترازی عددی کامل میان مسیرهای آموزش و rollout را نیز توسعه داده است. در ارزیابی سازگاری، میانگین اختلاف logprob در سطح 1e-7 کنترل شد که بیش از ۹۹.۹۹ درصد کمتر از تنظیمات قبلی است. همچنین ذخیره‌سازی محلی به‌عنوان لایه کش اضافی استفاده می‌شود و امکان استفاده از چند teacher را با منابع کمتر فراهم می‌کند.

برای بارهای کاری عامل‌محور و ناهمگام، زمان‌بندی مشترک و توازن بار میان router و slime در GLM-5.3 بهبود یافته است و heuristicهای آگاه از بار کاری نسبت منابع prefill و decode، هم‌زمانی و دیگر پارامترهای throughput را براساس ویژگی هر محیط تعیین می‌کنند. Z.ai می‌گوید نتیجه این تغییرات، افزایش بیش از ۲.۳ برابری throughput آموزش RL برای وظایف کدنویسی طولانی‌مدت بوده است؛ بنابراین آموزش روی مسیرهای طولانی‌تر و محیط‌های پیچیده‌تر با بهره‌وری بیشتری انجام می‌شود.

GLM-5.3 در API از سه سطح تلاش برای استدلال low، high و max پشتیبانی می‌کند و غیرفعال کردن thinking دیگر ممکن نیست. Z.ai حالت مکس را برای کدنویسی پیشنهاد کرده است. برنامه‌هایی که از thinking.type برابر disabled استفاده می‌کنند باید پیش از تغییر مدل به glm-5.3، آن را enabled کرده و reasoning_effort را روی low بگذارند؛ در غیر این صورت درخواست خطا می‌دهد. مدل اکنون در GLM Coding Plan عرضه شده است.

GLM-5.3 در ZCode، Claude Code و OpenCode قابل استفاده است و برای کاربران GLM Coding Plan عرضه شده است. طرح جدید سهمیه مبتنی بر امتیاز دارد و مصرف توکن ورودی، ورودی کش‌شده و خروجی جداگانه محاسبه می‌شود. درخواست‌های خارج از ساعات اوج ۵۰ درصد امتیاز استاندارد را مصرف می‌کنند؛ ساعات اوج ۱۴ تا ۱۸ به وقت UTC+8 در روزهای دوشنبه تا جمعه است و دیگر ساعات، از جمله آخر هفته، نرخ خارج از اوج دارند.

Z.ai در ZCode نرخ cache hit بیش از ۹۸ درصد را اعلام کرده و می‌گوید زمینه‌های تکراری با نرخ پایین‌تر کش محاسبه می‌شوند و حدود ۳۰ درصد توکن مؤثر بیشتری ایجاد می‌کنند. افزایش موقت ۱.۵ برابری سهمیه تا ۳۱ اوت فعال است و همراه صرفه‌جویی کش می‌تواند سهمیه را به ۱۸۰ درصد استاندارد برساند. Goal mode وظایف طولانی را برنامه‌ریزی، کدنویسی، تست و راستی‌آزمایی می‌کند و Remote Control امکان نظارت از گوشی را فراهم می‌کند.

Z.ai فعلاً وزن‌های GLM-5.3 را منتشر نکرده و اعلام کرده آن‌ها دو هفته پس از عرضه، پس از تکمیل ارزیابی ایمنی و سخت‌سازی، در دسترس قرار می‌گیرند. پاورقی‌ها نشان می‌دهند آزمون‌ها با تنظیمات متفاوتی انجام شده‌اند؛ برای نمونه HLE با دمای ۱، top_p برابر ۰.۹۵، حداکثر ۱۶۳۸۴۰ توکن خروجی و زمینه ۳۰۰ هزار توکنی اجرا شده و GPT-5.6-luna با سطح medium نقش داور را داشته است.

در SWE-Marathon، مدل جدید GLM-5.3 با حداکثر effort، temperature برابر ۱، top_p برابر ۰.۹۵، خروجی ۱۲۸ هزار توکن و زمینه یک میلیون توکنی آزمایش شده است. بررسی‌های ضدتقلب strip-clone که ممکن بود پیاده‌سازی‌های معتبر را رد کنند، با بازرسی LLM جایگزین شدند. برای parameter-golf و trimul-cuda نیز به‌دلیل تغییرات wheelهای NVIDIA، گزینه extra-index-url به PyPI اضافه شد تا ساخت imageهای Docker با موفقیت انجام شود.

منبع

ابوالفضل | ۳ ساعت پیش

دیدگاهتان را بنویسید