CoreTech

Xiaomi MiMo-V2.6-Pro

شیائومی از MiMo-V2.6-Pro رونمایی کرد، صدر نشینی مدل‌های متن‌باز هوش مصنوعی؟

ابوالفضل | ۱ روز پیش

شیائومی با معرفی خانواده MiMo-V2.6، مدل MiMo-V2.6-Pro را به صدر جدول مدل‌های هوش مصنوعی قابل‌دسترس عمومی رسانده است. این مدل در ارزیابی Intelligence Index مؤسسه Artificial Analysis امتیاز ۴۶ گرفت و بالاتر از Kimi K3 و Qwen قرار گرفت. قیمت پردازش آن نیز ۰.۴۳۵ دلار برای هر یک میلیون توکن ورودی و ۰.۸۷ دلار برای هر یک میلیون توکن خروجی اعلام شده است.

بر اساس محاسبات Artificial Analysis، اجرای یک وظیفه آزمایشی با MiMo-V2.6-Pro حدود ۰.۱۳ دلار هزینه دارد؛ رقمی که در مقایسه با مدل‌هایی با توانایی مشابه پایین‌تر است. به همین دلیل، این مدل در محدوده‌ای قرار می‌گیرد که از آن با عنوان Pareto frontier هوش و هزینه یاد می‌شود. نسخه‌ی پرو یک مدل Mixture-of-Experts با ۱.۰۲ تریلیون پارامتر است که در هر درخواست فقط ۴۲ میلیارد پارامتر آن فعال می‌شوند.

در کنار مدل MiMo-V2.6-Pro، نسخه کوچک‌تر و کم‌مصرف‌تر MiMo-V2.6-Flash نیز عرضه شده است. شیائومی دلیل اصلی جهش عملکرد خانواده جدید را گسترش چشمگیر مرحله یادگیری تقویتی یا RL می‌داند؛ فرآیندی که در آن مدل با آزمون، دریافت بازخورد و پاداش آموزش می‌بیند. این شرکت در این مرحله، هم حجم داده در هر گام آموزشی، هم تنوع محیط‌های کاری و هم توان محاسباتی اختصاص‌یافته به ارزیابی پاسخ‌ها را افزایش داده است.

شیائومی می‌گوید فرآیند یادگیری تقویتی مدل MiMo-V2.6-Pro در کمتر از شش روز انجام شده و هزینه آن حدود ۲.۶۲ میلیون دلار بوده است؛ هزینه آموزش MiMo-V2.6-Flash نیز به حدود ۰.۸۵ میلیون دلار رسیده است. در آزمون برنامه‌نویسی DeepSWE، امتیاز Pro از ۵۸.۴ به ۷۲.۶ افزایش یافت و امتیاز MiMo-V2.6-Flash نیز از ۴۸.۸ به ۶۵.۷ رسید. برای پایداری آموزش در این مقیاس، سازوکار توزیع داخلی مدل ثابت نگه داشته شد.

این شرکت همچنین محافظ‌هایی برای مقابله با تقلب در پاداش یا reward hacking اضافه کرده است؛ وضعیتی که در آن مدل به‌جای حل واقعی مسئله، راه‌هایی برای دریافت پاداش بیشتر پیدا می‌کند. شیائومی هم‌زمان نسخه‌ای سریع‌تر با نام Pro-UltraSpeed ارائه کرده که سرعت خروجی را تا ۲۰ برابر افزایش دهد. با این حال، بخش مهم دیگری از انتشار جدید، مربوط به باز کردن ابزارهای یادگیری تقویتی برای توسعه‌دهندگان است.

شیائومی گزارش فنی، چارچوب کامل آموزش، یک مدل کوچک‌تر و ۷ هزار وظیفه آماده با ارزیاب خودکار را منتشر می‌کند. این مجموعه حوزه‌هایی مانند توسعه نرم‌افزار، امنیت سایبری، کارهای اداری و طراحی وب را پوشش می‌دهد و هزار وظیفه نیز برای آهنگ‌سازی موسیقی دارد. بخشی از کدها از Pull Requestهای واقعی کارکنان و پرسش‌های کاربران گرفته شده و بخشی از شرح وظایف نیز توسط یک مدل زبانی تولید شده است.

منابع وظایف امنیتی شامل OSS-Fuzz و ده‌ها هزار آسیب‌پذیری واقعی نرم‌افزاری است، اما محیط‌های کاری اداری به‌صورت مصنوعی بازسازی شده‌اند. با وجود این رویکرد باز، انتشار مدل‌ها در شرایطی انجام شده که Anthropic دو هفته پیش اتهام‌هایی درباره استفاده از Claude برای استخراج داده آموزشی مدل‌ها مطرح کرد. این شرکت در گزارش اطلاعات تهدید خود، هفت آزمایشگاه از جمله شیائومی را به کارزارهای مرتبط با سوءاستفاده از Claude نسبت داد.

آنتروپیک ادعا کرده است این آزمایشگاه‌ها بین دسامبر ۲۰۲۵ تا اوت ۲۰۲۶ در مجموع ۱۹۰ میلیون تبادل برای استخراج توانایی Claude و آموزش مدل‌ها ایجاد کرده‌اند؛ روشی که Anthropic آن را illegal distillation می‌نامد. نام شیائومی در پرونده GTG-16008 است. طبق گزارش، ۴۰۰ هزار تبادل در ۲۰ روز مارس و آوریل ۲۰۲۶ ثبت شده که در آن شیائومی مکالمات کاربران و نشست‌های برنامه‌نویسی MiMo را از طریق OpenClaw و OpenCode به Claude منتقل کرده است.

بر اساس همان گزارش، هدف این فرآیند غنی‌تر کردن داده‌های آموزشی مدل‌های آینده بوده است. Anthropic همچنین تقریباً مستندی درباره منشأ داده‌های آموزشی و داده‌های معلم مورد استفاده در تقطیر داخلی مدل‌های خود ارائه نکرده است. ادعا این است که شیائومی مکالمات کاربران با مدل‌های MiMo را ثبت کرده و برای استخراج داده آموزشی در اختیار Claude گذاشته؛ ادعایی که در کنار انتشار فعلی خانواده MiMo-V2.6 قرار گرفته است.

منبع

ابوالفضل | ۱ روز پیش

دیدگاهتان را بنویسید