
علیبابا مدل Qwen3.8-Flash-Next را با تمرکز بر کاهش هزینه معرفی کرد
علیبابا با معرفی Qwen3.8-Flash-Next، مدل چندوجهی جدیدی را به نمایش گذاشته که معماری آن پیشنمایشی از Qwen4 محسوب میشود و تمرکز اصلیاش کاهش هزینه آموزش و اجرا است. این مدل ۱۲۵ میلیارد پارامتر دارد، اما در پردازش هر توکن فقط ۶ میلیارد پارامتر را فعال میکند و تیم Qwen میگوید مدل جدید با هزینه آموزشی حدود یکنهم Qwen3.7-Plus، در مجموع عملکرد بهتری ارائه میدهد.
یکی از نوآوریهای مهم Qwen3.8-Flash-Next، لایه N-gram embedding با ۵۱ میلیارد پارامتر است که قرار است در معماری Qwen4 نیز استفاده شود. این لایه گروههای رایج کلمات را بهصورت ورودیهای مستقل و شبیه یک فرهنگ لغت عبارتها نگهداری میکند و میتواند با هزینه اضافی نسبتاً پایین در رم معمولی سیستم قرار گیرد، نه اینکه الزاماً تماماً روی GPU اجرا شود. مدل همچنین بهطور بومی از پنجره زمینه ۲۶۲۱۴۴ توکنی پشتیبانی میکند.
البته با استفاده از YaRN، پنجره زمینه مدل میتواند تا یک میلیون توکن افزایش پیدا کند. گزارش فنی Qwen3.8-Flash-Next در GitHub منتشر شده و وزنهای آن نیز از طریق Hugging Face و ModelScope در دسترس هستند. نسخه تولیدی این مدل با نام Qwen3.8-Flash از طریق QwenCloud ارائه خواهد شد و قیمت آن برای هر یک میلیون توکن ورودی ۰.۱۶ دلار و برای هر یک میلیون توکن خروجی ۰.۴۷ دلار تعیین شده است.
در مقایسههای منتشرشده، Qwen3.8-Flash-Next با DeepSeek-V4-Flash و Claude Opus 4.6 (Max) سنجیده شده است. DeepSeek-V4-Flash دارای ۲۸۴ میلیارد پارامتر و ۱۳ میلیارد پارامتر فعال در هر توکن است، در حالی که Qwen3.7-Plus با ۳۹۷ میلیارد پارامتر، ۱۷ میلیارد پارامتر را فعال میکند. Flash-Next در بیشتر آزمونهای اعلامشده بالاتر قرار گرفت و بیشترین بهبود آن نسبت به Qwen3.7-Plus در کدنویسی و وظایف اداری دیده شد.
مقایسه و نتایج بنچمارک رسمی Qwen3.8-Flash-Next:

تمرکز مدل بر وظایف عاملمحور در نتایج کدنویسی نیز مشخص است و Qwen3.8 Flash Next در DeepSWE امتیاز ۵۸.۷ و در SWE-bench Pro امتیاز ۶۲.۵ گرفت و از DeepSeek-V4-Flash و Claude Opus 4.6 عبور کرد. در CoWorkBench نیز امتیاز ۷۳.۹ ثبت شد، در حالی که DeepSeek-V4-Flash به ۴۵.۱ رسید. در JobBench، امتیاز Flash-Next برابر ۵۵.۷ بود و تقریباً دو برابر Qwen3.7-Plus با امتیاز ۲۷.۶ شد.
در استدلال علمی Qwen3.8-Flash-Next در GPQA Diamond به امتیاز ۹۱.۷ و در برنامهنویسی رقابتی LiveCodeBench v6 به ۹۱.۹ رسید و عملکرد مدلها در این دو آزمون نزدیک بود. Claude Opus 4.6 تنها در Humanity’s Last Exam برتری داشت؛ آزمونی برای مسائل بسیار دشوار چندرشتهای، هرچند این مدل در فوریه ۲۰۲۶ عرضه شده و در مقایسه حاضر قدیمیتر محسوب میشود. Flash-Next کمی پایینتر از Qwen3.8-Max است، اما قیمتش تقریباً یکدوازدهم آن است.
Qwen3.8-Max که اوایل اوت بهعنوان مدل پرچمدار فعلی علیبابا معرفی شد، با Claude Opus 4.8، جمنای ۳۰.۱ پرو و GPT5.6 Sol رقابت میکند و قیمت آن برای هر یک میلیون توکن ورودی ۲ دلار و خروجی ۶ دلار است. در مقابل، Qwen3.8-Flash-Next بهترتیب ۰.۱۶ و ۰.۴۷ دلار هزینه دارد. Qwen3.8-27B نیز بهدلیل امکان اجرای محلی و عملکرد مناسب با هزینه بسیار پایین، اخیراً محبوب شده است.
رقابت قیمتی در بازار مدلهای هوش مصنوعی با این عرضه شدیدتر میشود و فشار بیشتری بر OpenAI و Anthropic وارد میکند. OpenAI نیز اخیراً برای مدلهای جدید GPT-5.6 تخفیفهای قابلتوجهی ارائه داده است. این روند برای کاربران مطلوب است، اما همزمان میتواند رشد سریع درآمد شرکتهای هوش مصنوعی را دشوارتر کند؛ شرکتهایی که برای حفظ روایت سرمایهگذاری در این صنعت به رشد درآمد نیاز دارند. با این حال، امتیازهای بنچمارک لزوماً عملکرد واقعی مدلها را نشان نمیدهند.




