CoreTech

xAI Grok 4.6

Grok 4.6 از xAI معرفی شد؛ تمرکز بیشتر بر ایجنت‌ها و پروژه‌های پیچیده

ابوالفضل | ۱ ساعت پیش

xAI از Grok 4.6 رونمایی کرده است؛ مدلی که در مقایسه با Grok 4.5 تمرکز بیشتری بر اجرای وظایف طولانی‌مدت، کدنویسی ایجنتی و پروژه‌های تعاملی و بصری دارد. این مدل در شاخص هوش Artificial Analysis امتیاز ۶۱ گرفته و با GPT-5.6 Sol برابری می‌کند. Grok 4.6 همچنین در چندین بنچمارک مربوط به کارهای دانشی و کدنویسی ایجنتی، عملکردی در سطح مدل‌های پیشرو نشان داده است.

Grok 4.6 برای انجام کارهایی طراحی شده که به چندین مرحله پیوسته نیاز دارند؛ از تحقیق درباره موضوعات ناآشنا و تحلیل اطلاعات گرفته تا کار روی کدبیس و تبدیل ایده به یک برنامه یا محصول کاری. آزمایش‌های xAI نشان داده‌اند مدل می‌تواند ساختار یک برنامه را شکل دهد، تعاملات اصلی را بسازد و پس از دریافت بازخورد، در چند دور بهبود ادامه دهد. در مسیرهای طولانی‌تر، خودآزمایی و بررسی نتیجه کار نیز بیشتر دیده شده است.

یکی از تغییرات مهم Grok 4.6 در پروژه‌های بصری و تعاملی دیده می‌شود، جایی که طبق ارزیابی xAI، این مدل نسبت به Grok 4.5 نسخه‌های اولیه قدرتمندتری تولید می‌کند و با دریافت یک ایده مشخص برای محصول، قادر است ساختار و زبان بصری برنامه را در یک مرحله ایجاد کند. همین قابلیت برای پروژه‌هایی مناسب است که ابتدا به یک نسخه نسبتاً کامل نیاز دارند و سپس با تکرار و بازخورد بهبود پیدا می‌کنند.

برای آموزش گراک ۴.۶، xAI یک مرحله آموزش تکمیلی طولانی‌تر از Grok 4.5 انجام داده است. در این مرحله از داده‌های تولیدشده و گزینش‌شده مدل برای استدلال و مفاهیم فنی پیشرفته، داده‌های مهندسی باکیفیت و یک بهینه‌ساز و دستورالعمل آموزشی بهبودیافته استفاده شد. xAI می‌گوید نتیجه این فرایند، پایه قوی‌تری برای مراحل SFT و RL بعدی فراهم کرده است.

در مرحله SFT، این شرکت از Grok 4.5 برای بازتولید مسیرهای آموزشی در سطوح مختلف تلاش استدلالی، محیط‌های ایجنتی و حوزه‌هایی مانند STEM، مهندسی نرم‌افزار و کارهای دانشی استفاده کرد. سپس مسیرهای مشکل‌دار با بررسی‌های مبتنی بر مدل کنار گذاشته شدند. نقطه بررسی SFT حاصل، به گفته xAI، عملکرد قدرتمندتر و رفتار بهبودیافته‌ای دارد. Grok 4.6 همچنین روی مجموعه گسترده‌ای از وظایف RL ایجنتی آموزش دیده است.

این وظایف RL حوزه‌هایی مانند کارهای دانشی، کدنویسی عمومی و محیط‌های تخصصی برای بهینه‌سازی کرنل، توسعه وب و طراحی به کمک رایانه را پوشش می‌دهند.

نتایج بنچمارک Grok 4.6 در مقابل نسل قبل و دو رقیب دیگر:

این شرکت هم‌زمان اعلام کرده است که سازوکارهای حفاظتی مدل جدید متناسب با قابلیت‌های جدید مدل بهبود و تنظیم شده‌اند. xAI می‌گوید سیستم ایمنی آن برای ایجاد تعادل میان کاربرد و امنیت در استفاده‌های قانونی طراحی شده و می‌تواند در حوزه‌هایی مانند اصلاح آسیب‌پذیری‌ها، کوتاه‌تر کردن چرخه طراحی مهندسی و تقویت پژوهش‌های هوش مصنوعی مورد استفاده قرار گیرد، ارزیابی ایمنی نیز گسترده‌تر شده است.

xAI برای گراک ۴.۶ گسترده‌ترین مجموعه آزمایش‌های پیش از عرضه خود برای ارزیابی قابلیت‌ها و تنظیم سازوکارهای حفاظتی را اجرا کرده و علاوه بر آن، آزمایش‌های گسترده پس از عرضه و ارزیابی‌های شخص ثالث را انجام داده است. این مدل اکنون در Cursor و Grok Build در دسترس قرار دارد و از طریق API نیز عرضه شده است. OpenRouter، Vercel و Cloudflare از دیگر شرکای ارائه‌دهنده Grok 4.6 هستند.

قیمت استفاده از محصول جدید xAI در API از ۲ دلار برای هر یک میلیون توکن ورودی و ۶ دلار برای هر یک میلیون توکن خروجی آغاز می‌شود. نسخه سریع این مدل نیز ارائه شده که هزینه آن دو برابر نسخه عادی است. xAI همچنین اعلام کرده است کاربران Cursor و Grok Build در هفته نخست، دو برابر میزان استفاده شامل‌شده را دریافت می‌کنند تا امکان آزمایش Grok 4.6 فراهم باشد.

منبع

ابوالفضل | ۱ ساعت پیش

دیدگاهتان را بنویسید