
علیبابا از Qwen3.8-Max؛ مدل متنباز ۲.۴ تریلیون پارامتری برای فعالیتهای طولانی رونمایی کرد
علیبابا از جدیدترین و قدرتمندترین مدل زبانی خود با نام Qwen3.8-Max پرده برداشته است؛ مدلی با مجموع ۲.۴ تریلیون پارامتر که در هر درخواست تنها ۹۵ میلیارد پارامتر آن فعال میشود. برخلاف بسیاری از مدلهای زبانی که برای پاسخگویی به درخواستهای کوتاه طراحی شدهاند، تمرکز اصلی این مدل انجام مستقل وظایف پیچیده و چندروزه است. همچنین Alibaba اعلام کرده وزنهای این مدل هفته آینده بهصورت عمومی منتشر خواهند شد و این نخستین عضو خانواده Qwen-Max با وزنهای متنباز است.
مدل Qwen3.8-Max بر پایه معماری Qwen3.5 توسعه یافته و نخستین بار در اواسط ژوئیه بهصورت نسخه پیشنمایش از طریق سرویسهای Alibaba Token Plan، Qoder و QoderWork با هزینهای معادل ۱۰ درصد قیمت عادی در دسترس قرار گرفت. در همان زمان تنها به مشخصات کلی مدل و قرار گرفتن آن پشت سر Fable 5 اشاره شده بود و هیچ نتیجهای از بنچمارکها منتشر نشد، اما اکنون علیبابا جزئیات بیشتری از عملکرد آن ارائه کرده است.
برای نمایش تواناییهای برنامهنویسی، تیم Qwen سه مطالعه موردی را منتشر کرده و در نخستین آزمایش، مدل طی ۱۶ روز ابزار خط فرمان oh-my-cli را بدون دخالت انسان توسعه داد؛ بهگونهای که درخواست کاربران را به Issueهای GitHub تبدیل میکرد، آنها را به خودش اختصاص میداد، کدنویسی میکرد، آزمایشها را اجرا و نتایج را بهصورت مداوم اصلاح میکرد. تا ۳۰ ژوئیه ۲۰۲۶ نیز ۲۶۵ کامیت، ۱۲۷ پول ریکوئست و ۱۵۱ Issue ثبت شده بود.
در دومین آزمایش، تنها مقاله پژوهشی Unified Data Selection for LLM Reasoning در اختیار کوِن۳.۸ مکس قرار گرفت و هیچ کد اولیهای وجود نداشت. Qwen3.8-Max طی حدود پنج روز و نزدیک به ۱۲۵ ساعت پردازش، ۷۶۰۰ خط کد نوشت و ۳۳ فرایند آموزش روی GPU اجرا کرد. این مدل ابتدا هر شش نتیجه اصلی مقاله را بازتولید کرد و سپس با آزمایش ۱۸ ایده در چهار مرحله، عملکرد روش اصلی را در بنچمارک AIME24 به میزان ۲.۷ امتیاز بهبود داد.
مطالعه سوم به رقابت WWW2025 Multimodal Dialogue Intent Recognition Challenge در پلتفرم Tianchi اختصاص داشت؛ رقابتی که ۵۲۶ تیم انسانی در آن حضور داشتند. مدل ظرف ۲۴ ساعت چندین مدل زبان چینی را همراه با Qwen2.5-VL-7B برای تحلیل تصاویر محصولات تنظیم دقیق کرد و آنها را در قالب یک سیستم رأیگیری ترکیب کرد. نتیجه این فرایند افزایش دقت از ۰.۶۰ به ۰.۸۵۳ در ۴۵ ارسال و قرار گرفتن بالاتر از ۴۵۸ تیم بود.
علیبابا دو آزمایش دیگر را نیز برای سنجش توانایی برنامهریزی بلندمدت مدل انجام داد و در نخستین مورد، Qwen3.8-Max وظیفه طراحی یک بلوک رمزنگاری را بر عهده داشت و طی حدود ۵۰۰ مرحله تعداد گیتهای منطقی آن را از ۸۲۹۸ به ۶۷۸ کاهش داد. پس از اجرای فرایند چیدمان با ابزار متنباز OpenROAD نیز ابعاد فیزیکی تراشه از ۱۰۶ در ۱۰۶ به ۴۶ در ۴۶ میکرومتر رسید که کاهش ۸۱ درصدی را نشان میدهد.
دومین آزمایش بلندمدت با بنچمارک E-Commerce-Bench انجام شد که یک سال کامل فعالیت فروشگاههای اینترنتی را بر پایه دادههای ناشناس Taobao و Tmall شبیهسازی میکند. کوِن ۳.۸ مکس با سرمایه اولیه ۱۰۰ هزار یوان چند فروشگاه را همزمان مدیریت کرد، با تأمینکنندگان مذاکره داشت، قیمتها را تغییر داد، مرجوعیها را مدیریت کرد و با بحرانهایی مانند طوفان و اختلال زنجیره تأمین روبهرو شد. همچنین باید ۱۵۲ کلاهبردار را نیز شناسایی میکرد.
در پایان این شبیهسازی، موجودی Qwen3.8 Max به ۴۱۶ هزار و ۲۵۲ یوان رسید؛ رقمی که بیش از چهار برابر سرمایه اولیه است. این نتیجه ۳۸ درصد بهتر از GLM 5.2 و بیش از ۲.۵ برابر عملکرد Qwen3.7-Max بود. به گفته تیم توسعهدهنده، مدل در ابتدای سال رویکردی تهاجمی برای سرمایهگذاری در پیش گرفت و در فصل تعطیلات نیز بیش از ۱۰۰ هزار یوان سود خالص به دست آورد.
در بخش قابلیتهای چندرسانهای، Alibaba اعلام میکند Qwen3.8-Max توانایی پردازش اسناد بیش از ۲۰۰ صفحه و ویدئوهای بیش از ۱۰۰ ساعت را دارد. این شرکت همچنین از بنچمارک RecreationBench رونمایی کرده که در آن مدل باید بدون دسترسی به کد منبع، تنها از طریق تعامل با برنامه شامل کلیک و ورودی صفحهکلید، نرمافزارها را روی اوبونتو، macOS، ویندوز، اندروید و وب بازسازی کند.
نتایج برخی بنچمارکهای Qwen3.8-Max:



همزمان کتابخانه Qwen-MM-Plugins نیز معرفی شده که قابلیتهایی مانند پردازش تصویر و ویدئو، استفاده از ابزارهای بصری و حافظه چندرسانهای را به سامانههای عامل اضافه میکند. در بنچمارکهای داخلی، Qwen3.8-Max در بسیاری از آزمونها همسطح یا بالاتر از Claude Opus 4.8، Claude Fable 5 و GPT-5.6 Sol ظاهر شده است. این مدل در PaperBench امتیاز ۹۳ و در TerminalBench 2.1 امتیاز ۸۶.۶ را ثبت کرد، هرچند این نتایج هنوز بهصورت مستقل تأیید نشدهاند.
به گفته تیم Qwen علت اصلی این پیشرفت گسترش محیطهای آموزشی در مرحله یادگیری تقویتی بوده است؛ بهطوری که آموزش تنها به وظایف منفرد محدود نبوده و جریانهای کاری چندروزه، ساختارهای پیچیده پوشهها و چارچوبهای مختلف عامل را نیز شامل شده است. شاخص داخلی این تیم در بیش از ۱۰ بنچمارک از ۰.۴۷۴ به ۰.۷۲۵ افزایش یافته و بهترین عملکرد نیز در حدود ۴۰۰۰ محیط آموزشی ثبت شده است.
مهمترین رقیب Qwen3.8-Max، مدل کیمی K3 از شرکت چینی Moonshot AI محسوب میشود که ۲۷ ژوئیه با وزنهای متنباز در Hugging Face منتشر شد. این مدل از معماری Mixture-of-Experts بهره میبرد، ۲.۸ تریلیون پارامتر و پنجره متنی یک میلیون توکنی دارد و همراه با بخشی از زیرساخت نرمافزاری شرکت عرضه شده است، اما آزمایشهای مستقل نشان دادهاند عملکرد آن در تواناییهای سایبری و ریاضیات پیچیده به سطح بهترین مدلهای غربی نمیرسد.
Qwen3.8-Max هماکنون از طریق QwenCloud قابل استفاده است و وزنهای آن هفته آینده در Hugging Face و ModelScope منتشر میشوند. این مدل از قالب OpenAI Chat Completions و پروتکل API شرکت Anthropic پشتیبانی میکند و با ابزارهایی مانند Claude Code، Codex، Qoder CLI، Qwen Code و OpenClaw سازگار است. همچنین پارامتر reasoning_effort سه سطح مختلف را برای ایجاد تعادل میان سرعت و دقت استدلال در اختیار کاربران قرار میدهد.




