
شیائومی از MiMo-V2.6-Pro رونمایی کرد، صدر نشینی مدلهای متنباز هوش مصنوعی؟
شیائومی با معرفی خانواده MiMo-V2.6، مدل MiMo-V2.6-Pro را به صدر جدول مدلهای هوش مصنوعی قابلدسترس عمومی رسانده است. این مدل در ارزیابی Intelligence Index مؤسسه Artificial Analysis امتیاز ۴۶ گرفت و بالاتر از Kimi K3 و Qwen قرار گرفت. قیمت پردازش آن نیز ۰.۴۳۵ دلار برای هر یک میلیون توکن ورودی و ۰.۸۷ دلار برای هر یک میلیون توکن خروجی اعلام شده است.
بر اساس محاسبات Artificial Analysis، اجرای یک وظیفه آزمایشی با MiMo-V2.6-Pro حدود ۰.۱۳ دلار هزینه دارد؛ رقمی که در مقایسه با مدلهایی با توانایی مشابه پایینتر است. به همین دلیل، این مدل در محدودهای قرار میگیرد که از آن با عنوان Pareto frontier هوش و هزینه یاد میشود. نسخهی پرو یک مدل Mixture-of-Experts با ۱.۰۲ تریلیون پارامتر است که در هر درخواست فقط ۴۲ میلیارد پارامتر آن فعال میشوند.
در کنار مدل MiMo-V2.6-Pro، نسخه کوچکتر و کممصرفتر MiMo-V2.6-Flash نیز عرضه شده است. شیائومی دلیل اصلی جهش عملکرد خانواده جدید را گسترش چشمگیر مرحله یادگیری تقویتی یا RL میداند؛ فرآیندی که در آن مدل با آزمون، دریافت بازخورد و پاداش آموزش میبیند. این شرکت در این مرحله، هم حجم داده در هر گام آموزشی، هم تنوع محیطهای کاری و هم توان محاسباتی اختصاصیافته به ارزیابی پاسخها را افزایش داده است.

شیائومی میگوید فرآیند یادگیری تقویتی مدل MiMo-V2.6-Pro در کمتر از شش روز انجام شده و هزینه آن حدود ۲.۶۲ میلیون دلار بوده است؛ هزینه آموزش MiMo-V2.6-Flash نیز به حدود ۰.۸۵ میلیون دلار رسیده است. در آزمون برنامهنویسی DeepSWE، امتیاز Pro از ۵۸.۴ به ۷۲.۶ افزایش یافت و امتیاز MiMo-V2.6-Flash نیز از ۴۸.۸ به ۶۵.۷ رسید. برای پایداری آموزش در این مقیاس، سازوکار توزیع داخلی مدل ثابت نگه داشته شد.
این شرکت همچنین محافظهایی برای مقابله با تقلب در پاداش یا reward hacking اضافه کرده است؛ وضعیتی که در آن مدل بهجای حل واقعی مسئله، راههایی برای دریافت پاداش بیشتر پیدا میکند. شیائومی همزمان نسخهای سریعتر با نام Pro-UltraSpeed ارائه کرده که سرعت خروجی را تا ۲۰ برابر افزایش دهد. با این حال، بخش مهم دیگری از انتشار جدید، مربوط به باز کردن ابزارهای یادگیری تقویتی برای توسعهدهندگان است.
شیائومی گزارش فنی، چارچوب کامل آموزش، یک مدل کوچکتر و ۷ هزار وظیفه آماده با ارزیاب خودکار را منتشر میکند. این مجموعه حوزههایی مانند توسعه نرمافزار، امنیت سایبری، کارهای اداری و طراحی وب را پوشش میدهد و هزار وظیفه نیز برای آهنگسازی موسیقی دارد. بخشی از کدها از Pull Requestهای واقعی کارکنان و پرسشهای کاربران گرفته شده و بخشی از شرح وظایف نیز توسط یک مدل زبانی تولید شده است.
منابع وظایف امنیتی شامل OSS-Fuzz و دهها هزار آسیبپذیری واقعی نرمافزاری است، اما محیطهای کاری اداری بهصورت مصنوعی بازسازی شدهاند. با وجود این رویکرد باز، انتشار مدلها در شرایطی انجام شده که Anthropic دو هفته پیش اتهامهایی درباره استفاده از Claude برای استخراج داده آموزشی مدلها مطرح کرد. این شرکت در گزارش اطلاعات تهدید خود، هفت آزمایشگاه از جمله شیائومی را به کارزارهای مرتبط با سوءاستفاده از Claude نسبت داد.
آنتروپیک ادعا کرده است این آزمایشگاهها بین دسامبر ۲۰۲۵ تا اوت ۲۰۲۶ در مجموع ۱۹۰ میلیون تبادل برای استخراج توانایی Claude و آموزش مدلها ایجاد کردهاند؛ روشی که Anthropic آن را illegal distillation مینامد. نام شیائومی در پرونده GTG-16008 است. طبق گزارش، ۴۰۰ هزار تبادل در ۲۰ روز مارس و آوریل ۲۰۲۶ ثبت شده که در آن شیائومی مکالمات کاربران و نشستهای برنامهنویسی MiMo را از طریق OpenClaw و OpenCode به Claude منتقل کرده است.
بر اساس همان گزارش، هدف این فرآیند غنیتر کردن دادههای آموزشی مدلهای آینده بوده است. Anthropic همچنین تقریباً مستندی درباره منشأ دادههای آموزشی و دادههای معلم مورد استفاده در تقطیر داخلی مدلهای خود ارائه نکرده است. ادعا این است که شیائومی مکالمات کاربران با مدلهای MiMo را ثبت کرده و برای استخراج داده آموزشی در اختیار Claude گذاشته؛ ادعایی که در کنار انتشار فعلی خانواده MiMo-V2.6 قرار گرفته است.




