CoreTech

Alibaba Qwen3.8-Max

علی‌بابا از Qwen3.8-Max؛ مدل متن‌باز ۲.۴ تریلیون پارامتری برای فعالیت‌های طولانی رونمایی کرد

ابوالفضل | ۳ ساعت پیش

علی‌بابا از جدیدترین و قدرتمندترین مدل زبانی خود با نام Qwen3.8-Max پرده برداشته است؛ مدلی با مجموع ۲.۴ تریلیون پارامتر که در هر درخواست تنها ۹۵ میلیارد پارامتر آن فعال می‌شود. برخلاف بسیاری از مدل‌های زبانی که برای پاسخ‌گویی به درخواست‌های کوتاه طراحی شده‌اند، تمرکز اصلی این مدل انجام مستقل وظایف پیچیده و چندروزه است. همچنین Alibaba اعلام کرده وزن‌های این مدل هفته آینده به‌صورت عمومی منتشر خواهند شد و این نخستین عضو خانواده Qwen-Max با وزن‌های متن‌باز است.

مدل Qwen3.8-Max بر پایه معماری Qwen3.5 توسعه یافته و نخستین بار در اواسط ژوئیه به‌صورت نسخه پیش‌نمایش از طریق سرویس‌های Alibaba Token Plan، Qoder و QoderWork با هزینه‌ای معادل ۱۰ درصد قیمت عادی در دسترس قرار گرفت. در همان زمان تنها به مشخصات کلی مدل و قرار گرفتن آن پشت سر Fable 5 اشاره شده بود و هیچ نتیجه‌ای از بنچمارک‌ها منتشر نشد، اما اکنون علی‌بابا جزئیات بیشتری از عملکرد آن ارائه کرده است.

برای نمایش توانایی‌های برنامه‌نویسی، تیم Qwen سه مطالعه موردی را منتشر کرده و در نخستین آزمایش، مدل طی ۱۶ روز ابزار خط فرمان oh-my-cli را بدون دخالت انسان توسعه داد؛ به‌گونه‌ای که درخواست کاربران را به Issueهای GitHub تبدیل می‌کرد، آن‌ها را به خودش اختصاص می‌داد، کدنویسی می‌کرد، آزمایش‌ها را اجرا و نتایج را به‌صورت مداوم اصلاح می‌کرد. تا ۳۰ ژوئیه ۲۰۲۶ نیز ۲۶۵ کامیت، ۱۲۷ پول ریکوئست و ۱۵۱ Issue ثبت شده بود.

در دومین آزمایش، تنها مقاله پژوهشی Unified Data Selection for LLM Reasoning در اختیار کوِن۳.۸ مکس قرار گرفت و هیچ کد اولیه‌ای وجود نداشت. Qwen3.8-Max طی حدود پنج روز و نزدیک به ۱۲۵ ساعت پردازش، ۷۶۰۰ خط کد نوشت و ۳۳ فرایند آموزش روی GPU اجرا کرد. این مدل ابتدا هر شش نتیجه اصلی مقاله را بازتولید کرد و سپس با آزمایش ۱۸ ایده در چهار مرحله، عملکرد روش اصلی را در بنچمارک AIME24 به میزان ۲.۷ امتیاز بهبود داد.

مطالعه سوم به رقابت WWW2025 Multimodal Dialogue Intent Recognition Challenge در پلتفرم Tianchi اختصاص داشت؛ رقابتی که ۵۲۶ تیم انسانی در آن حضور داشتند. مدل ظرف ۲۴ ساعت چندین مدل زبان چینی را همراه با Qwen2.5-VL-7B برای تحلیل تصاویر محصولات تنظیم دقیق کرد و آن‌ها را در قالب یک سیستم رأی‌گیری ترکیب کرد. نتیجه این فرایند افزایش دقت از ۰.۶۰ به ۰.۸۵۳ در ۴۵ ارسال و قرار گرفتن بالاتر از ۴۵۸ تیم بود.

علی‌بابا دو آزمایش دیگر را نیز برای سنجش توانایی برنامه‌ریزی بلندمدت مدل انجام داد و در نخستین مورد، Qwen3.8-Max وظیفه طراحی یک بلوک رمزنگاری را بر عهده داشت و طی حدود ۵۰۰ مرحله تعداد گیت‌های منطقی آن را از ۸۲۹۸ به ۶۷۸ کاهش داد. پس از اجرای فرایند چیدمان با ابزار متن‌باز OpenROAD نیز ابعاد فیزیکی تراشه از ۱۰۶ در ۱۰۶ به ۴۶ در ۴۶ میکرومتر رسید که کاهش ۸۱ درصدی را نشان می‌دهد.

دومین آزمایش بلندمدت با بنچمارک E-Commerce-Bench انجام شد که یک سال کامل فعالیت فروشگاه‌های اینترنتی را بر پایه داده‌های ناشناس Taobao و Tmall شبیه‌سازی می‌کند. کوِن ۳.۸ مکس با سرمایه اولیه ۱۰۰ هزار یوان چند فروشگاه را هم‌زمان مدیریت کرد، با تأمین‌کنندگان مذاکره داشت، قیمت‌ها را تغییر داد، مرجوعی‌ها را مدیریت کرد و با بحران‌هایی مانند طوفان و اختلال زنجیره تأمین روبه‌رو شد. همچنین باید ۱۵۲ کلاهبردار را نیز شناسایی می‌کرد.

در پایان این شبیه‌سازی، موجودی Qwen3.8 Max به ۴۱۶ هزار و ۲۵۲ یوان رسید؛ رقمی که بیش از چهار برابر سرمایه اولیه است. این نتیجه ۳۸ درصد بهتر از GLM 5.2 و بیش از ۲.۵ برابر عملکرد Qwen3.7-Max بود. به گفته تیم توسعه‌دهنده، مدل در ابتدای سال رویکردی تهاجمی برای سرمایه‌گذاری در پیش گرفت و در فصل تعطیلات نیز بیش از ۱۰۰ هزار یوان سود خالص به دست آورد.

در بخش قابلیت‌های چندرسانه‌ای، Alibaba اعلام می‌کند Qwen3.8-Max توانایی پردازش اسناد بیش از ۲۰۰ صفحه و ویدئوهای بیش از ۱۰۰ ساعت را دارد. این شرکت همچنین از بنچمارک RecreationBench رونمایی کرده که در آن مدل باید بدون دسترسی به کد منبع، تنها از طریق تعامل با برنامه شامل کلیک و ورودی صفحه‌کلید، نرم‌افزارها را روی اوبونتو، macOS، ویندوز، اندروید و وب بازسازی کند.

نتایج برخی بنچمارک‌های Qwen3.8-Max:

هم‌زمان کتابخانه Qwen-MM-Plugins نیز معرفی شده که قابلیت‌هایی مانند پردازش تصویر و ویدئو، استفاده از ابزارهای بصری و حافظه چندرسانه‌ای را به سامانه‌های عامل اضافه می‌کند. در بنچمارک‌های داخلی، Qwen3.8-Max در بسیاری از آزمون‌ها هم‌سطح یا بالاتر از Claude Opus 4.8، Claude Fable 5 و GPT-5.6 Sol ظاهر شده است. این مدل در PaperBench امتیاز ۹۳ و در TerminalBench 2.1 امتیاز ۸۶.۶ را ثبت کرد، هرچند این نتایج هنوز به‌صورت مستقل تأیید نشده‌اند.

به گفته تیم Qwen علت اصلی این پیشرفت گسترش محیط‌های آموزشی در مرحله یادگیری تقویتی بوده است؛ به‌طوری که آموزش تنها به وظایف منفرد محدود نبوده و جریان‌های کاری چندروزه، ساختارهای پیچیده پوشه‌ها و چارچوب‌های مختلف عامل را نیز شامل شده است. شاخص داخلی این تیم در بیش از ۱۰ بنچمارک از ۰.۴۷۴ به ۰.۷۲۵ افزایش یافته و بهترین عملکرد نیز در حدود ۴۰۰۰ محیط آموزشی ثبت شده است.

مهم‌ترین رقیب Qwen3.8-Max، مدل کیمی K3 از شرکت چینی Moonshot AI محسوب می‌شود که ۲۷ ژوئیه با وزن‌های متن‌باز در Hugging Face منتشر شد. این مدل از معماری Mixture-of-Experts بهره می‌برد، ۲.۸ تریلیون پارامتر و پنجره متنی یک میلیون توکنی دارد و همراه با بخشی از زیرساخت نرم‌افزاری شرکت عرضه شده است، اما آزمایش‌های مستقل نشان داده‌اند عملکرد آن در توانایی‌های سایبری و ریاضیات پیچیده به سطح بهترین مدل‌های غربی نمی‌رسد.

Qwen3.8-Max هم‌اکنون از طریق QwenCloud قابل استفاده است و وزن‌های آن هفته آینده در Hugging Face و ModelScope منتشر می‌شوند. این مدل از قالب OpenAI Chat Completions و پروتکل API شرکت Anthropic پشتیبانی می‌کند و با ابزارهایی مانند Claude Code، Codex، Qoder CLI، Qwen Code و OpenClaw سازگار است. همچنین پارامتر reasoning_effort سه سطح مختلف را برای ایجاد تعادل میان سرعت و دقت استدلال در اختیار کاربران قرار می‌دهد.

منبع

ابوالفضل | ۳ ساعت پیش

دیدگاهتان را بنویسید