CoreTech

Alibaba Qwen3.8-Flash-Next

علی‌بابا مدل Qwen3.8-Flash-Next را با تمرکز بر کاهش هزینه معرفی کرد

ابوالفضل | ۱۷ ساعت پیش

علی‌بابا با معرفی Qwen3.8-Flash-Next، مدل چندوجهی جدیدی را به نمایش گذاشته که معماری آن پیش‌نمایشی از Qwen4 محسوب می‌شود و تمرکز اصلی‌اش کاهش هزینه آموزش و اجرا است. این مدل ۱۲۵ میلیارد پارامتر دارد، اما در پردازش هر توکن فقط ۶ میلیارد پارامتر را فعال می‌کند و تیم Qwen می‌گوید مدل جدید با هزینه آموزشی حدود یک‌نهم Qwen3.7-Plus، در مجموع عملکرد بهتری ارائه می‌دهد.

یکی از نوآوری‌های مهم Qwen3.8-Flash-Next، لایه N-gram embedding با ۵۱ میلیارد پارامتر است که قرار است در معماری Qwen4 نیز استفاده شود. این لایه گروه‌های رایج کلمات را به‌صورت ورودی‌های مستقل و شبیه یک فرهنگ لغت عبارت‌ها نگهداری می‌کند و می‌تواند با هزینه اضافی نسبتاً پایین در رم معمولی سیستم قرار گیرد، نه اینکه الزاماً تماماً روی GPU اجرا شود. مدل همچنین به‌طور بومی از پنجره زمینه ۲۶۲۱۴۴ توکنی پشتیبانی می‌کند.

البته با استفاده از YaRN، پنجره زمینه مدل می‌تواند تا یک میلیون توکن افزایش پیدا کند. گزارش فنی Qwen3.8-Flash-Next در GitHub منتشر شده و وزن‌های آن نیز از طریق Hugging Face و ModelScope در دسترس هستند. نسخه تولیدی این مدل با نام Qwen3.8-Flash از طریق QwenCloud ارائه خواهد شد و قیمت آن برای هر یک میلیون توکن ورودی ۰.۱۶ دلار و برای هر یک میلیون توکن خروجی ۰.۴۷ دلار تعیین شده است.

در مقایسه‌های منتشرشده، Qwen3.8-Flash-Next با DeepSeek-V4-Flash و Claude Opus 4.6 (Max) سنجیده شده است. DeepSeek-V4-Flash دارای ۲۸۴ میلیارد پارامتر و ۱۳ میلیارد پارامتر فعال در هر توکن است، در حالی که Qwen3.7-Plus با ۳۹۷ میلیارد پارامتر، ۱۷ میلیارد پارامتر را فعال می‌کند. Flash-Next در بیشتر آزمون‌های اعلام‌شده بالاتر قرار گرفت و بیشترین بهبود آن نسبت به Qwen3.7-Plus در کدنویسی و وظایف اداری دیده شد.

مقایسه و نتایج بنچمارک رسمی Qwen3.8-Flash-Next:

تمرکز مدل بر وظایف عامل‌محور در نتایج کدنویسی نیز مشخص است و Qwen3.8 Flash Next در DeepSWE امتیاز ۵۸.۷ و در SWE-bench Pro امتیاز ۶۲.۵ گرفت و از DeepSeek-V4-Flash و Claude Opus 4.6 عبور کرد. در CoWorkBench نیز امتیاز ۷۳.۹ ثبت شد، در حالی که DeepSeek-V4-Flash به ۴۵.۱ رسید. در JobBench، امتیاز Flash-Next برابر ۵۵.۷ بود و تقریباً دو برابر Qwen3.7-Plus با امتیاز ۲۷.۶ شد.

در استدلال علمی Qwen3.8-Flash-Next در GPQA Diamond به امتیاز ۹۱.۷ و در برنامه‌نویسی رقابتی LiveCodeBench v6 به ۹۱.۹ رسید و عملکرد مدل‌ها در این دو آزمون نزدیک بود. Claude Opus 4.6 تنها در Humanity’s Last Exam برتری داشت؛ آزمونی برای مسائل بسیار دشوار چندرشته‌ای، هرچند این مدل در فوریه ۲۰۲۶ عرضه شده و در مقایسه حاضر قدیمی‌تر محسوب می‌شود. Flash-Next کمی پایین‌تر از Qwen3.8-Max است، اما قیمتش تقریباً یک‌دوازدهم آن است.

Qwen3.8-Max که اوایل اوت به‌عنوان مدل پرچم‌دار فعلی علی‌بابا معرفی شد، با Claude Opus 4.8، جمنای ۳۰.۱ پرو و GPT5.6 Sol رقابت می‌کند و قیمت آن برای هر یک میلیون توکن ورودی ۲ دلار و خروجی ۶ دلار است. در مقابل، Qwen3.8-Flash-Next به‌ترتیب ۰.۱۶ و ۰.۴۷ دلار هزینه دارد. Qwen3.8-27B نیز به‌دلیل امکان اجرای محلی و عملکرد مناسب با هزینه بسیار پایین، اخیراً محبوب شده است.

رقابت قیمتی در بازار مدل‌های هوش مصنوعی با این عرضه شدیدتر می‌شود و فشار بیشتری بر OpenAI و Anthropic وارد می‌کند. OpenAI نیز اخیراً برای مدل‌های جدید GPT-5.6 تخفیف‌های قابل‌توجهی ارائه داده است. این روند برای کاربران مطلوب است، اما هم‌زمان می‌تواند رشد سریع درآمد شرکت‌های هوش مصنوعی را دشوارتر کند؛ شرکت‌هایی که برای حفظ روایت سرمایه‌گذاری در این صنعت به رشد درآمد نیاز دارند. با این حال، امتیازهای بنچمارک لزوماً عملکرد واقعی مدل‌ها را نشان نمی‌دهند.

منبع

ابوالفضل | ۱۷ ساعت پیش

دیدگاهتان را بنویسید