
مدل جدید GLM-5.3 رونمایی شد؛ جهش کدنویسی و ظهور قابلیتهای سایبری غیرمنتظره
شرکت Z.ai از GLM-5.3 رونمایی کرد؛ مدلی که بدون تغییر مدل پایه GLM-5.2 و تنها با گسترش آموزش پس از پیشآموزش توسعه یافته است. تمرکز نسخه جدید روی کدنویسی پیچیده و وظایف عاملمحور طولانیمدت است، اما مهمترین نکته معرفی آن به قابلیتهای امنیت سایبری بازمیگردد. Z.ai میگوید این تواناییها در جریان افزایش مقیاس آموزش سریعتر از انتظار رشد کردهاند و مدل در مراحل مختلف بهرهبرداری از آسیبپذیریها نیز توانمندتر شده است.
شرکت چینی Z.ai ادعا میکند GLM-5.3 توانمندترین مدل دارای وزنهای باز برای کدنویسی است و در معیار داخلی Z.ai Code Bench حدود ۵۰ درصد نسبت به GLM-5.2 پیشرفت کرده است. این شرکت همچنین میگوید مدل جدید در معیارهای عمومی Terminal-Bench 3.0 و Agents’ Last Exam به بهترین عملکرد میان مدلهای متنباز رسیده است. تمام این دستاوردها، طبق اعلام Z.ai، از مرحله پساآموزش حاصل شده و مدل پایه همان نسخه قبلی باقی مانده است.
در مقایسه مستقیم با GLM-5.2، امتیاز GLM-5.3 در Terminal-Bench 3.0 از ۴.۶ به ۲۸.۳ رسیده است. در DeepSWE v1.1 نیز امتیاز دو نسل از ۴۶.۲ به ۶۶.۹ افزایش یافته و در Agents’ Last Exam از ۲۳.۸ به ۲۸.۵ رسیده است. این نتایج نشان میدهند بیشترین اثر افزایش مقیاس آموزش در وظایف طولانیمدت و پیچیده ظاهر شده است، نه صرفاً در تمرینهای کوتاه کدنویسی.
Z.ai برای سنجش نزدیکتر به کاربرد واقعی، معیار خصوصی Z.ai Code Bench را ساخته است و این آزمون عاملهای کدنویسی را در محیطهای توسعه محلی پیچیده و در دستههای متنوع وظایف بررسی میکند و دو شاخص نرخ تکمیل کامل وظیفه و دقت چکلیست را میسنجد. خصوصی بودن معیار نیز به گفته شرکت خطر آلودگی ناشی از مجموعهآزمونهای عمومی را کاهش میدهد و تصویر دقیقتری از تجربه کاربر ارائه میکند.
مقایسه GLM-5.3 با دیگر مدلهای مطرح:


در Z.ai Code Bench، مدل GLM-5.3 در سطح مکس به امتیاز ۳۴.۵ درصد با حدود ۷۵ هزار توکن خروجی برای هر وظیفه رسیده است؛ در حالی که GLM-5.2 با مصرف حدود ۹۶ هزار توکن، ۲۳.۴ درصد ثبت کرده بود. در سطح High نیز GLM-5.3 با حدود ۵۰ هزار توکن به ۳۱.۴ درصد رسید و Claude Opus 4.8 با ۱۲۰ هزار توکن، امتیاز ۲۹.۵ درصد گرفت.
با وجود این برتری، GLM-5.3 در همه مقایسهها صدرنشین نیست و مثلا Claude Fable 5 در سطح Max به امتیاز ۳۹.۵ درصد میرسد و بالاتر از مدل جدید Z.ai قرار دارد. Z.ai تأکید دارد محیطهای آموزشی GLM-5.3 اکنون بیشتر شبیه واحدهای واقعی کار تخصصی هستند. برخی وظایف حتی معادل چند روز کار مهندس باتجربهاند و مدل باید کار را از تشخیص مسئله تا اجرای راهحل و سنجش نتیجه پیش ببرد.
برای مثال، در یک وظیفه زیرساخت یادگیری ماشین، مدل میتواند به کلاسترهای محاسباتی، ذخیرهسازی، مستندات داخلی، کدها و نتایج آزمایش دسترسی داشته باشد. عامل باید گلوگاههای زنجیره آموزش را پیدا کند، بهینهسازی انجام دهد، آزمایش اجرا کند و بدون از بین بردن صحت عملکرد، سرعت کلی را بهطور قابلاندازهگیری افزایش دهد. Z.ai برای تولید چنین محیطهایی از عاملهای پژوهشی، داورهای خودکار و راستیآزماهای تولیدشده استفاده میکند.
راستیآزماها بدون دسترسی به راهحل مرجع ساخته میشوند و مسیرهای اجرای حلکننده برای کشف میانبرهای پاداش به کار میروند. راستیآزمایی که آزمونهای oracle، no-op و unsolved-state را پشت سر بگذارد، میتواند پاداش دودویی قابلاعتمادی تولید کند. با این حال، Z.ai میگوید این خطوط پردازشی همچنان به میزان قابلتوجهی دخالت انسانی نیاز دارند. GLM-5.3 همچنین راهبرد SAO همراه با compaction را از GLM-5.2 به ارث برده است.
دومین محور مهم معرفی GLM-5.3، قابلیت امنیت سایبری آن است که Z.ai دادهها و محیطهای کشف آسیبپذیری را وارد فرایند پساآموزش کرد و انتظار داشت مدل در شناسایی نقصهای منفرد بهتر شود. با افزایش مقیاس، اما رفتار مدل فراتر رفت و توانست درباره چند مرحله بهرهبرداری استدلال کند. شرکت میگوید مدل شروع به ساخت برنامههای منسجم برای زنجیرههای کامل بهرهبرداری کرد؛ قابلیتی که رشد آن سریعتر از انتظار بود.
در CyberGym، که کشف و اعتبارسنجی آسیبپذیری را از روی کد منبع white-box میسنجد، GLM-5.3 به امتیاز ۸۴.۵ درصد رسیده است؛ در حالی که GLM-5.2 امتیاز ۷۷.۲ درصد داشت. این نتیجه از Mythos 5 با ۸۳.۸ درصد و GPT-5.6 Sol با ۸۳.۶ درصد نیز بالاتر است. در ExploitBench، GLM-5.3 به ۵۴.۴ درصد رسیده و بیش از دو برابر امتیاز ۲۴.۴ درصدی نسل قبلی را ثبت کرده است.
در ExploitBench، با وجود رشد چشمگیر GLM-5.3، کلاد Mythos 5 با ۷۸ درصد و GPT-5.6 Sol با ۷۶.۵ درصد همچنان بالاتر هستند. در ExploitGym نیز مدل جدید طی دو ساعت ۱۰۵ وظیفه و طی شش ساعت ۱۳۰ وظیفه را تکمیل کرده است؛ اعداد GLM-5.2 در همین بازهها ۲۹ و ۳۹ وظیفه بودند. Mythos 5 با ۱۸۱ و ۲۴۷ وظیفه همچنان فاصله محسوسی با GLM-5.3 دارد.
الگوی هر سه آزمون از نگاه Z.ai یکسان است: هرچه معیار به مراحل بالاتری از زنجیره بهرهبرداری نزدیک میشود، رشد GLM-5.3 نسبت به GLM-5.2 بیشتر است؛ در عین حال فاصله با مدلهای بسته پیشرو نیز افزایش پیدا میکند. شرکت برای بررسی انتقال این قابلیت به دنیای واقعی، همراه چند تیم امنیتی در چین مدلها را روی کدهای واقعی آزمایش کرده و پس از بررسی متخصصان، غربالگری و حذف موارد تکراری، یافتهها را ثبت کرده است.
طبق اعلام Z.ai، این فرایند در مجموع به شناسایی ۲۴۳۶ آسیبپذیری در ۲۶۹ پروژه منجر شده که ۱۰۹۷ مورد از آنها شدت متوسط تا بالا داشتهاند. یافتهها سیستمکرنلها، سیستمعاملها، موتورهای مرورگر، زیرساختهای متنباز، برنامههای وب و پروتکلهای شبکه را پوشش میدهند. بسیاری از این مشکلات سالها یا حتی دههها شناسایی نشده بودند و قدیمیترین مورد، به گفته شرکت، حدود ۴۰ سال در کد باقی مانده بود.
Z.ai این فعالیت را به یک برنامه مستمر افشا تبدیل کرده و برای آن Z.ai Security Disclosure Ledger را ساخته است. این دفترکل با بررسی و انتشار یافتههای جدید بهروزرسانی میشود و میان مواردی که عمومی شدهاند و آسیبپذیریهای در حال افشا تفاوت میگذارد. برای موارد منتشرشده، اطلاعاتی مانند پروژه آسیبدیده، شدت، CVE در صورت وجود و مدت باقی ماندن آسیبپذیری در کد ثبت میشود تا روند افشا قابل پیگیری باشد.
در زیرساخت آموزش، همه این فرایندها روی slime اجرا میشوند؛ چارچوب متنباز Z.ai برای افزایش مقیاس RL پساآموزشی که Megatron را در بخش آموزش و SGLang را در rollout به کار میگیرد. طراحی slime آموزش، rollout و بافر داده را در یک جریان قرار میدهد تا ریاضیات، کد، sandboxها، راستیآزماها و محیطهای عاملمحور بهعنوان داده تولیدشده وارد شوند و برای افزودن محیطهای تازه نیازی به بازسازی حلقه آموزش نباشد.
Z.ai در slime قابلیتهایی مانند top-p mask، top-k و full-vocabulary OPD را اضافه کرده و تنظیمات R3-style و همترازی عددی کامل میان مسیرهای آموزش و rollout را نیز توسعه داده است. در ارزیابی سازگاری، میانگین اختلاف logprob در سطح 1e-7 کنترل شد که بیش از ۹۹.۹۹ درصد کمتر از تنظیمات قبلی است. همچنین ذخیرهسازی محلی بهعنوان لایه کش اضافی استفاده میشود و امکان استفاده از چند teacher را با منابع کمتر فراهم میکند.
برای بارهای کاری عاملمحور و ناهمگام، زمانبندی مشترک و توازن بار میان router و slime در GLM-5.3 بهبود یافته است و heuristicهای آگاه از بار کاری نسبت منابع prefill و decode، همزمانی و دیگر پارامترهای throughput را براساس ویژگی هر محیط تعیین میکنند. Z.ai میگوید نتیجه این تغییرات، افزایش بیش از ۲.۳ برابری throughput آموزش RL برای وظایف کدنویسی طولانیمدت بوده است؛ بنابراین آموزش روی مسیرهای طولانیتر و محیطهای پیچیدهتر با بهرهوری بیشتری انجام میشود.

GLM-5.3 در API از سه سطح تلاش برای استدلال low، high و max پشتیبانی میکند و غیرفعال کردن thinking دیگر ممکن نیست. Z.ai حالت مکس را برای کدنویسی پیشنهاد کرده است. برنامههایی که از thinking.type برابر disabled استفاده میکنند باید پیش از تغییر مدل به glm-5.3، آن را enabled کرده و reasoning_effort را روی low بگذارند؛ در غیر این صورت درخواست خطا میدهد. مدل اکنون در GLM Coding Plan عرضه شده است.
GLM-5.3 در ZCode، Claude Code و OpenCode قابل استفاده است و برای کاربران GLM Coding Plan عرضه شده است. طرح جدید سهمیه مبتنی بر امتیاز دارد و مصرف توکن ورودی، ورودی کششده و خروجی جداگانه محاسبه میشود. درخواستهای خارج از ساعات اوج ۵۰ درصد امتیاز استاندارد را مصرف میکنند؛ ساعات اوج ۱۴ تا ۱۸ به وقت UTC+8 در روزهای دوشنبه تا جمعه است و دیگر ساعات، از جمله آخر هفته، نرخ خارج از اوج دارند.
Z.ai در ZCode نرخ cache hit بیش از ۹۸ درصد را اعلام کرده و میگوید زمینههای تکراری با نرخ پایینتر کش محاسبه میشوند و حدود ۳۰ درصد توکن مؤثر بیشتری ایجاد میکنند. افزایش موقت ۱.۵ برابری سهمیه تا ۳۱ اوت فعال است و همراه صرفهجویی کش میتواند سهمیه را به ۱۸۰ درصد استاندارد برساند. Goal mode وظایف طولانی را برنامهریزی، کدنویسی، تست و راستیآزمایی میکند و Remote Control امکان نظارت از گوشی را فراهم میکند.
Z.ai فعلاً وزنهای GLM-5.3 را منتشر نکرده و اعلام کرده آنها دو هفته پس از عرضه، پس از تکمیل ارزیابی ایمنی و سختسازی، در دسترس قرار میگیرند. پاورقیها نشان میدهند آزمونها با تنظیمات متفاوتی انجام شدهاند؛ برای نمونه HLE با دمای ۱، top_p برابر ۰.۹۵، حداکثر ۱۶۳۸۴۰ توکن خروجی و زمینه ۳۰۰ هزار توکنی اجرا شده و GPT-5.6-luna با سطح medium نقش داور را داشته است.
در SWE-Marathon، مدل جدید GLM-5.3 با حداکثر effort، temperature برابر ۱، top_p برابر ۰.۹۵، خروجی ۱۲۸ هزار توکن و زمینه یک میلیون توکنی آزمایش شده است. بررسیهای ضدتقلب strip-clone که ممکن بود پیادهسازیهای معتبر را رد کنند، با بازرسی LLM جایگزین شدند. برای parameter-golf و trimul-cuda نیز بهدلیل تغییرات wheelهای NVIDIA، گزینه extra-index-url به PyPI اضافه شد تا ساخت imageهای Docker با موفقیت انجام شود.




