
مدل جدید GLM-5.3-Flash با هزینه کمتر از یک نهم اما عملکرد بدون افت چشمگیر رونمایی شد
GLM-5.3-Flash شرکت Z.ai با تمرکز بر کاهش هزینه استنتاج معرفی شده است؛ مدلی که ۳۲۰ میلیارد پارامتر دارد، اما تنها ۱۸ میلیارد پارامتر آن در هر مرحله فعال میشود. این مدل نخستین مدل چندوجهی بومی خانواده GLM-5 است و با پنجره زمینه یک میلیون توکنی و مجوز MIT عرضه شده است. در ارزیابی Artificial Analysis نیز با امتیاز ۵۷، تنها سه امتیاز از GLM-5.3 عقبتر قرار میگیرد.
مهمترین مزیت GLM-5.3-Flash در نسبت عملکرد به هزینه دیده میشود، جایی که هزینه هر وظیفه این مدل در شاخص Artificial Analysis حدود ۰.۰۹ دلار است، در حالی که GLM-5.3 برای همان معیار ۰.۶۸ دلار هزینه دارد؛ یعنی مدل جدید حدود ۷.۵ برابر ارزانتر است. GLM-5.3-Flash در این شاخص همسطح GPT-5.6 Terra و Muse Spark 1.2 قرار گرفته و در محدوده مرزی میان هوش و هزینه ارزیابی شده است.
در API شرکت Z.ai، هزینه پردازش یک میلیون توکن ورودی ۰.۱۵ دلار و یک میلیون توکن خروجی ۰.۵۰ دلار تعیین شده است؛ قیمتی که کمی بیشتر از ۱۰ درصد هزینه GLM-5.3 محسوب میشود. با این حال مدل همیشه از نظر تعداد توکنهای مصرفی بهینه نیست و Artificial Analysis گزارش کرده است که حدود ۹۰ درصد توکنهای خروجی آن صرف فرایند استدلال میشود و این موضوع میتواند روی هزینه نهایی استفاده تأثیر بگذارد.
Z.ai برای کاهش هزینه محاسباتی، GLM-5.3-Flash را بر پایه معماری Mixture-of-Experts ساخته است و مدل در مجموع ۳۲۰ میلیارد پارامتر دارد، اما فقط ۱۸ میلیارد پارامتر را فعال میکند. این رقم در GLM-4.5 برابر ۳۲ میلیارد بود، در حالی که تعداد پارامترهای کلی از ۳۵۵ میلیارد به ۳۲۰ میلیارد کاهش یافته است. تعداد لایهها نیز از ۹۲ لایه در GLM-4.5 به ۴۵ لایه رسیده است.
پشتیبانی از زمینه یک میلیون توکنی نیز با تغییر معماری Attention همراه شده است و GLM-5.3-Flash از ترکیب Linear Attention و Sparse Attention استفاده میکند؛ بخش نخست برای مدلسازی وضعیت و وابستگیهای محلی و بخش دوم برای یافتن اطلاعات مرتبط در بخشهای دورتر زمینه به کار میرود. Z.ai همچنین فناوری IndexPool را معرفی کرده که چهار بردار کلیدی ایندکسر را با weighted pooling به یک بردار فشرده تبدیل میکند.
بنچمارکهای رسمی Z.ai در رابطه با GLM-5.3-Flash و مقایسه با رقبا:




این تغییرات مستقیماً روی مصرف منابع اثر گذاشتهاند و Z.ai میگوید GLM-5.3-Flash نسبت به GLM-5.3 به حدود سه برابر محاسبات Attention کمتر و ۴.۴ برابر حجم KV Cache کمتر نیاز دارد. مدل همچنین برای وظایف برنامهنویسی عملکرد قدرتمندی نشان داده است؛ در Terminal Bench 2.1 امتیاز ۸۴.۳، در DeepSWE v1.1 امتیاز ۶۳.۴ و در NL2Repo امتیاز ۵۶.۳ کسب کرده است.
در ارزیابی Z.ai Code Bench v1.0، مدل جدید در تمام سطوح تلاش استدلالی از GLM-5.2 بهتر عمل کرده و در بالاترین سطح امتیاز مدل ۲۹ بوده، در حالی که Claude Opus 4.8 امتیاز ۲۹.۵ کسب کرده است. در وظایف عاملمحور نیز مدل در GDPval-AA v2 به امتیاز Elo حدود ۱۷۷۰ رسیده و با GLM-5.3 و Grok 4.6 برابری کرده است، اما Claude Opus 5 بالاتر قرار دارد.
GLM-5.3-Flash علاوه بر متن و کد، قابلیتهای چندوجهی بومی دارد و میتواند از متن، تصویر، ویدیو و فایل در فرایند استدلال استفاده کند. Z.ai این توانایی را برای توسعه رابط کاربری، بازی و شبیهسازی سهبعدی نیز در نظر گرفته است؛ جایی که مدل میتواند خروجی بصری را بررسی و ایرادهای آن را اصلاح کند. دادههای آموزشی چندوجهی مدل نیز به ۳۰ تریلیون توکن رسیده است.
مدل جدید z.AI در چند ارزیابی بینایی نیز نتایج مختلفی ثبت کرده است؛ از جمله امتیاز ۶۲.۴ در OfficeQA Pro، امتیاز ۸۹.۴ در CharXiv Reasoning با ابزار و ۷۸ در Chartography با ابزار. GLM-5.3-Flash همچنین برای پردازش فایلهای PPTX، PDF، DOCX و XLSX طراحی شده و میتواند خروجی رندرشده را برای شناسایی مشکلاتی مانند همپوشانی، برش نامناسب یا ایرادهای چیدمان بررسی کند.
اما یکی از مهمترین جنبههای معرفی محصول جدید به زیرساخت اجرای آن مربوط میشود، جایی که Z.ai پیش از عرضه رسمی، GLM-5.3-Flash را با نام ناشناس ox-alpha در OpenCode و OpenRouter آزمایش کرد و این مدل به محبوبترین مدل هفته تبدیل شد. طبق اعلام شرکت، تمام ترافیک این آزمایشها روی تراشههای هوش مصنوعی چینی اجرا شد. SemiAnalysis نیز گزارش داده است که این زیرساخت به ظرفیت حدود ۱۰۰ تریلیون توکن در روز رسیده است.
Z.ai برای اجرای مدل روی سختافزار چینی، نرمافزار سروینگ خود را بر پایه SGLang توسعه داده و پردازش را به مراحلی تقسیم کرده است که میتوانند مستقل از یکدیگر مقیاس پیدا کنند. این شرکت از روشهایی مانند Intra-node Tensor Parallelism، ReplaySSM، کوانتایزیشن W8A8، ترکیب INT8، FP8 و BF16 برای cache و Layer Split استفاده کرده است. معماری Encode–Prefill–Decode نیز وظایف مختلف را در worker poolهای مستقل توزیع میکند.
اهمیت این موضوع به وابستگی گسترده صنعت هوش مصنوعی به CUDA انویدیا برمیگردد؛ لایهای نرمافزاری که طی نزدیک به ۲۰ سال توسعه یافته و بسیاری از چارچوبهای هوش مصنوعی برای آن بهینه شدهاند. Z.ai میگوید بهینهسازیهای انجامشده توان عملیاتی را نسبت به نخستین اجرای مدل روی همان سختافزار سه برابر کرده است و بهرهوری سختافزار و هزینه هر توکن به سطحی قابل مقایسه با GPUهای رایج انویدیا رسیده است.
GLM 5.3 Flash با مجوز MIT منتشر شده و وزنهای باز آن در Hugging Face قرار گرفتهاند. این مدل از SGLang، vLLM و TokenSpeed پشتیبانی میکند و Z.ai قصد دارد گزینههای بیشتری را اضافه کند. مدل در Coding Plan این شرکت نیز در دسترس قرار گرفته و کاربران این سرویس سه برابر سهمیه GLM-5.3 دریافت میکنند. در ZCode نیز قابلیتهایی مانند Browser Use و Computer Use برای تعامل بصری با وب و محیط دسکتاپ در اختیار مدل قرار گرفته است.




