CoreTech

Z.ai GLM-5.3-FLASH

مدل جدید GLM-5.3-Flash با هزینه کمتر از یک نهم اما عملکرد بدون افت چشمگیر رونمایی شد

ابوالفضل | ۱۴ ساعت پیش

GLM-5.3-Flash شرکت Z.ai با تمرکز بر کاهش هزینه استنتاج معرفی شده است؛ مدلی که ۳۲۰ میلیارد پارامتر دارد، اما تنها ۱۸ میلیارد پارامتر آن در هر مرحله فعال می‌شود. این مدل نخستین مدل چندوجهی بومی خانواده GLM-5 است و با پنجره زمینه یک میلیون توکنی و مجوز MIT عرضه شده است. در ارزیابی Artificial Analysis نیز با امتیاز ۵۷، تنها سه امتیاز از GLM-5.3 عقب‌تر قرار می‌گیرد.

مهم‌ترین مزیت GLM-5.3-Flash در نسبت عملکرد به هزینه دیده می‌شود، جایی که هزینه هر وظیفه این مدل در شاخص Artificial Analysis حدود ۰.۰۹ دلار است، در حالی که GLM-5.3 برای همان معیار ۰.۶۸ دلار هزینه دارد؛ یعنی مدل جدید حدود ۷.۵ برابر ارزان‌تر است. GLM-5.3-Flash در این شاخص هم‌سطح GPT-5.6 Terra و Muse Spark 1.2 قرار گرفته و در محدوده مرزی میان هوش و هزینه ارزیابی شده است.

در API شرکت Z.ai، هزینه پردازش یک میلیون توکن ورودی ۰.۱۵ دلار و یک میلیون توکن خروجی ۰.۵۰ دلار تعیین شده است؛ قیمتی که کمی بیشتر از ۱۰ درصد هزینه GLM-5.3 محسوب می‌شود. با این حال مدل همیشه از نظر تعداد توکن‌های مصرفی بهینه نیست و Artificial Analysis گزارش کرده است که حدود ۹۰ درصد توکن‌های خروجی آن صرف فرایند استدلال می‌شود و این موضوع می‌تواند روی هزینه نهایی استفاده تأثیر بگذارد.

Z.ai برای کاهش هزینه محاسباتی، GLM-5.3-Flash را بر پایه معماری Mixture-of-Experts ساخته است و مدل در مجموع ۳۲۰ میلیارد پارامتر دارد، اما فقط ۱۸ میلیارد پارامتر را فعال می‌کند. این رقم در GLM-4.5 برابر ۳۲ میلیارد بود، در حالی که تعداد پارامترهای کلی از ۳۵۵ میلیارد به ۳۲۰ میلیارد کاهش یافته است. تعداد لایه‌ها نیز از ۹۲ لایه در GLM-4.5 به ۴۵ لایه رسیده است.

پشتیبانی از زمینه یک میلیون توکنی نیز با تغییر معماری Attention همراه شده است و GLM-5.3-Flash از ترکیب Linear Attention و Sparse Attention استفاده می‌کند؛ بخش نخست برای مدل‌سازی وضعیت و وابستگی‌های محلی و بخش دوم برای یافتن اطلاعات مرتبط در بخش‌های دورتر زمینه به کار می‌رود. Z.ai همچنین فناوری IndexPool را معرفی کرده که چهار بردار کلیدی ایندکسر را با weighted pooling به یک بردار فشرده تبدیل می‌کند.

بنچمارک‌های رسمی Z.ai در رابطه با GLM-5.3-Flash و مقایسه با رقبا:

این تغییرات مستقیماً روی مصرف منابع اثر گذاشته‌اند و Z.ai می‌گوید GLM-5.3-Flash نسبت به GLM-5.3 به حدود سه برابر محاسبات Attention کمتر و ۴.۴ برابر حجم KV Cache کمتر نیاز دارد. مدل همچنین برای وظایف برنامه‌نویسی عملکرد قدرتمندی نشان داده است؛ در Terminal Bench 2.1 امتیاز ۸۴.۳، در DeepSWE v1.1 امتیاز ۶۳.۴ و در NL2Repo امتیاز ۵۶.۳ کسب کرده است.

در ارزیابی Z.ai Code Bench v1.0، مدل جدید در تمام سطوح تلاش استدلالی از GLM-5.2 بهتر عمل کرده و در بالاترین سطح امتیاز مدل ۲۹ بوده، در حالی که Claude Opus 4.8 امتیاز ۲۹.۵ کسب کرده است. در وظایف عامل‌محور نیز مدل در GDPval-AA v2 به امتیاز Elo حدود ۱۷۷۰ رسیده و با GLM-5.3 و Grok 4.6 برابری کرده است، اما Claude Opus 5 بالاتر قرار دارد.

GLM-5.3-Flash علاوه بر متن و کد، قابلیت‌های چندوجهی بومی دارد و می‌تواند از متن، تصویر، ویدیو و فایل در فرایند استدلال استفاده کند. Z.ai این توانایی را برای توسعه رابط کاربری، بازی و شبیه‌سازی سه‌بعدی نیز در نظر گرفته است؛ جایی که مدل می‌تواند خروجی بصری را بررسی و ایرادهای آن را اصلاح کند. داده‌های آموزشی چندوجهی مدل نیز به ۳۰ تریلیون توکن رسیده است.

مدل جدید z.AI در چند ارزیابی بینایی نیز نتایج مختلفی ثبت کرده است؛ از جمله امتیاز ۶۲.۴ در OfficeQA Pro، امتیاز ۸۹.۴ در CharXiv Reasoning با ابزار و ۷۸ در Chartography با ابزار. GLM-5.3-Flash همچنین برای پردازش فایل‌های PPTX، PDF، DOCX و XLSX طراحی شده و می‌تواند خروجی رندرشده را برای شناسایی مشکلاتی مانند هم‌پوشانی، برش نامناسب یا ایرادهای چیدمان بررسی کند.

اما یکی از مهم‌ترین جنبه‌های معرفی محصول جدید به زیرساخت اجرای آن مربوط می‌شود، جایی که Z.ai پیش از عرضه رسمی، GLM-5.3-Flash را با نام ناشناس ox-alpha در OpenCode و OpenRouter آزمایش کرد و این مدل به محبوب‌ترین مدل هفته تبدیل شد. طبق اعلام شرکت، تمام ترافیک این آزمایش‌ها روی تراشه‌های هوش مصنوعی چینی اجرا شد. SemiAnalysis نیز گزارش داده است که این زیرساخت به ظرفیت حدود ۱۰۰ تریلیون توکن در روز رسیده است.

Z.ai برای اجرای مدل روی سخت‌افزار چینی، نرم‌افزار سروینگ خود را بر پایه SGLang توسعه داده و پردازش را به مراحلی تقسیم کرده است که می‌توانند مستقل از یکدیگر مقیاس پیدا کنند. این شرکت از روش‌هایی مانند Intra-node Tensor Parallelism، ReplaySSM، کوانتایزیشن W8A8، ترکیب INT8، FP8 و BF16 برای cache و Layer Split استفاده کرده است. معماری Encode–Prefill–Decode نیز وظایف مختلف را در worker poolهای مستقل توزیع می‌کند.

اهمیت این موضوع به وابستگی گسترده صنعت هوش مصنوعی به CUDA انویدیا برمی‌گردد؛ لایه‌ای نرم‌افزاری که طی نزدیک به ۲۰ سال توسعه یافته و بسیاری از چارچوب‌های هوش مصنوعی برای آن بهینه شده‌اند. Z.ai می‌گوید بهینه‌سازی‌های انجام‌شده توان عملیاتی را نسبت به نخستین اجرای مدل روی همان سخت‌افزار سه برابر کرده است و بهره‌وری سخت‌افزار و هزینه هر توکن به سطحی قابل مقایسه با GPUهای رایج انویدیا رسیده است.

GLM 5.3 Flash با مجوز MIT منتشر شده و وزن‌های باز آن در Hugging Face قرار گرفته‌اند. این مدل از SGLang، vLLM و TokenSpeed پشتیبانی می‌کند و Z.ai قصد دارد گزینه‌های بیشتری را اضافه کند. مدل در Coding Plan این شرکت نیز در دسترس قرار گرفته و کاربران این سرویس سه برابر سهمیه GLM-5.3 دریافت می‌کنند. در ZCode نیز قابلیت‌هایی مانند Browser Use و Computer Use برای تعامل بصری با وب و محیط دسکتاپ در اختیار مدل قرار گرفته است.

منبع

ابوالفضل | ۱۴ ساعت پیش

دیدگاهتان را بنویسید