CoreTech

گوگل Gemini 4 Argon را با تمرکز بر استدلال عمیق، مهندسی نرم‌افزار و امنیت سایبری معرفی کرد

پوریا | ۱۶ ساعت پیش

گوگل از Gemini 4 Argon به‌عنوان مدل جدید فرانتیر خود رونمایی کرده؛ مدلی که فعلاً از طریق برنامه Fairwind در اختیار گروهی از مدافعان مورداعتماد حوزه امنیت سایبری قرار می‌گیرد و برای استدلال عمیق در فرایندهای طولانی و پیچیده طراحی شده. این مدل در مهندسی نرم‌افزار، کارهای سازمانی مانند امور حقوقی و مالی و دفاع سایبری تمرکز دارد و با رویکرد عرضه مرحله‌ای ارائه می‌شود.

گوگل می‌گوید Gemini 4 Argon پیش از عرضه عمومی در حال استفاده داخلی است و هزاران کارمند برای کدنویسی تخصصی، پژوهش عمیق‌تر و نگارش از آن استفاده کرده‌اند. در یک نمونه، مدل منابع زمانی و فضایی الگوریتم‌های کوانتومی را بهینه کرد و نتیجه‌ای ۴۰ درصد بهتر از خط مبنای منتشرشده به دست آورد. تحلیل داده‌های مراکز داده نیز بیش از ۳۰۰ ترابایت حافظه آزاد کرده و صرفه‌جویی نهایی ۵۰۰ ترابایت تا یک پتابایت برآورد شده است.

Gemini 4 Argon

گوگل Gemini 4 Argon برای مهاجرت کدهای C و C پلاس پلاس به Rust در پروژه‌های گوگل به کار گرفته می‌شود؛ از کتابخانه‌هایی مانند re2 و libgav1 تا بیش از ۸۰۰ هزار خط کد در هسته Fuchsia Zircon؛ گوگل می‌گوید این بازنویسی‌های حساس پیش از تولید، حسابرسی خودکار و دستی، آزمایش شبیه‌سازی و بازبینی می‌شوند. در libgav1 نیز ۳۲ هزار خط SIMD با Rust ایمن جایگزین و رمزگشای ویدیو ۲.۷ برابر سریع‌تر شده.

یکی از تغییرات مهم Gemini 4 Argon افزایش سقف خروجی از ۶۴ هزار به یک میلیون توکن است؛ رقمی که گوگل آن را رکوردی در صنعت می‌داند. این ظرفیت به مدل اجازه می‌دهد در یک مسیر طولانی، صدها هزار توکن تولید کند و مسائل دشوار را عمیق‌تر بررسی کند. پنجره ورودی نیز یک میلیون توکن باقی مانده است. Gemini 4 Argon متن، تصویر، ویدیو و صدا را دریافت می‌کند اما خروجی آن فقط متنی است.

در ارزیابی‌های معرفی‌شده Argon در DeepSWE v1.1 به امتیاز ۷۷.۹ درصد رسیده و گوگل آن را برای مهندسی نرم‌افزار واقعی و طولانی‌مدت در سطحی پیشرو معرفی می‌کند. این مدل در Vals Index نیز جایگاه نخست را دارد؛ شاخصی که اثر اقتصادی کارهای مالی، کدنویسی، حقوقی و مالیاتی را با وزن‌دهی بر اساس سهم آن‌ها از تولید ناخالص داخلی آمریکا می‌سنجد. در Vals Finance Agent v2 و ارزیابی حقوقی Harvey نیز عملکرد پیشرو گزارش شده است.

در AutomationBench متعلق به Zapier مدل Gemini 4 Argon امتیاز ۵۱.۳ درصد و رتبه نخست را ثبت کرده. درک بصری نیز از قابلیت‌های مورد تأکید گوگل است؛ مدل می‌تواند نمودارهای حرفه‌ای را تحلیل کند، جزئیات ویدیوهای طولانی را تشخیص دهد و بر پایه اسناد اقدام کند. در LVBench که درک ویدیوهای طولانی را می‌سنجد، امتیاز ۹۱.۷ درصد برای Argon گزارش شده. در امنیت سایبری نیز مدل قادر به یافتن، اعتبارسنجی و وصله آسیب‌پذیری‌های مهم است.

مدل Gemini 4 Argon در برنامه Scan for Good شرکت Wiz برای دفاع رایگان از زیرساخت‌های عمومی حیاتی به کار گرفته شده و طبق گزارش، یک آسیب‌پذیری مهم را در نرم‌افزارهای درمانی بیمارستان‌های سراسر جهان کشف کرده. این نقص می‌توانست اطلاعات شخصی حساس را در معرض خطر قرار دهد. در CWE-bench v1، Argon با امتیاز ۶۸ درصد در جایگاه نخست مشترک قرار گرفته.

عرضه گسترده این مدل هنوز آغاز نشده و گوگل پیش از آن روی ایمنی تمرکز دارد. مدل برای مقابله با سوءاستفاده‌های سایبری و حملات CBRN از درخواست‌های مخرب خودداری می‌کند و پژوهش‌های علمی دوکاربردی مشروع را حفظ می‌کند. نظارت بر فعال‌سازی‌های داخلی برای شناسایی سوءاستفاده تقویت شده و آزمون تیم‌های قرمز انجام شده. Argon در برابر تزریق غیرمستقیم فرمان نیز با آموزش خصمانه و آزمون خودکار، در معیار IPI شرکت Gray Swan عملکرد پیشرو دارد.

مقایسه عملکرد Gemini 4 Argon با دیگر رقبا:

از نظر جایگاه محصول Gemini 4 Argon در منبع حاضر مدلی کاملاً عمومی نیست و فعلاً برای مدافعان مورداعتماد سایبری عرضه می‌شود. گوگل می‌گوید توسعه دسترسی به‌صورت مرحله‌ای انجام خواهد شد و بازخورد کاربران اولیه برای بهبود سازوکارهای ایمنی به کار می‌رود. این شرکت در فرایند داوطلبانه دولت آمریکا برای دسترسی پیش از عرضه نیز مشارکت دارد و قصد دارد پس از آن، مدل را به توسعه‌دهندگان، سازمان‌ها و مصرف‌کنندگان ارائه کند.

قیمت معرفی‌شده برای Gemini 4 Argon برابر با ۲ دلار به ازای هر یک میلیون توکن ورودی و ۱۰ دلار برای هر یک میلیون توکن خروجی است. ورودی‌های کش‌شده نیز ۹۵ درصد ارزان‌تر محاسبه می‌شوند؛ یعنی حدود ۰.۱۰ دلار برای هر میلیون توکن. پس از دوره معرفی، قیمت به ۴ دلار برای ورودی و ۲۰ دلار برای خروجی می‌رسد. در جدول، GPT-6 Astra برابر ۱۰ و ۵۰ دلار قیمت‌گذاری شده است.

در بخش هزینه کش جدول منبع برای GPT-6 Astra رقم یک دلار، برای Claude Fable 5.1 رقم ۰.۲۵ دلار و برای Claude Opus 5.5 رقم ۰.۲۰ دلار به ازای هر میلیون توکن نشان می‌دهد. هزینه نوشتن کش برای GPT-6 Astra برابر ۱۲.۵ دلار، برای Fable 5.1 بین ۱۲.۵ تا ۲۰ دلار و برای Opus 5.5 بین ۵ تا ۸ دلار ذکر شده؛ هرچند برای Gemini 4 Argon هزینه نوشتن کش اعلام نشده.

یکی از نکات فنی مهم افزایش سقف خروجی از ۶۴ هزار به یک میلیون توکن است؛ قابلیتی که گوگل آن را نخستین نمونه در صنعت معرفی می‌کند. برای جلوگیری از توقف پاسخ‌های طولانی، Gemini API قابلیت Long Decode Continuation را اضافه می‌کند تا پاسخ متوقف شود و با درخواست‌های بعدی ادامه پیدا کند. پنجره زمینه ورودی نیز یک میلیون توکن است و مدل متن، تصویر، ویدیو و صدا را می‌پذیرد، اما فقط متن تولید می‌کند.

ارزیابی مستقل Artificial Analysis تصویر متعادل‌تری از عملکرد Argon ارائه می‌دهد؛ این مدل در بالاترین سطح استدلال High امتیاز ۵۳ در Intelligence Index گرفته و با GPT-6 Astra و Claude Fable 5.1 برابر شده و GPT-6.1 Sol یک امتیاز پایین‌تر دارد؛ Claude Opus 5.5 با ۵۸ و Claude Sonnet 5.5 با ۵۶ امتیاز بالاتر قرار گرفته‌اند. Argon نسبت به Gemini 3.1 Pro Preview نیز ۲۳ امتیاز رشد کرده.

مقایسه عملکرد Gemini 4 Argon با رقبا

از نظر هزینه هر وظیفه در Intelligence Index اجرای Gemini 4 Argon با قیمت تبلیغاتی حدود ۱.۹۹ دلار برآورد شده که ۶۰ درصد هزینه GPT-6 Astra و ۲.۷ برابر GPT-6.1 Sol است. پس از پایان تخفیف هزینه به حدود ۳.۹۸ دلار می‌رسد و حدود ۲۰ درصد بیشتر از Astra خواهد بود. مزیت فعلی بیشتر از نرخ پایین توکن می‌آید زیرا Gemini 4 Argon به‌طور متوسط ۶۲ هزار توکن خروجی مصرف می‌کند، در برابر ۲۷ هزار توکن برای Astra.

مدل هوش مصنوعی Gemini 4 Argon گوگل در AutomationBench-AA به ۷۷.۵ درصد رسیده و در منبع شش امتیاز بالاتر از Claude Sonnet 5.5 معرفی شده. در Terminal Bench 4 نیز امتیاز ۵۷ درصد دارد که نسبت به Gemini 3.1 Pro Preview جهشی ۵۳ امتیازی است اما پایین‌تر از Sonnet 5.5 با ۶۴، Opus 5.5 با ۶۰ و GPT-6 Astra با ۵۹ درصد قرار می‌گیرد؛ در AA-Omniscience نرخ توهم ۱۵ درصد گزارش شده.

در AA-Omniscience دقت Argon به ۵۰ درصد رسیده؛ پنج امتیاز پایین‌تر از Gemini 3.1 Pro Preview و ۱۳ امتیاز کمتر از GPT-6 Astra با ۶۳ درصد. امتیاز کلی آن ۴۲ است، در برابر ۴۳ برای Astra و ۴۲ برای GPT-6.1 Sol؛ Vals AI امتیاز ۶۸.۹ درصد و جایگاه نخست را به Argon داده و آن را در ۲۰ مورد از ۲۲ ارزیابی در پنج رتبه قرار داده است.

در Arena.ai، مدل Gemini 4 Argon در Text Arena با ۱۵۲۵ امتیاز اول شده و ۲۰ امتیاز بالاتر از Claude Opus 4.6 قرار گرفته؛ این مدل در کدنویسی، پرسش‌های دشوار، پیروی از دستورها، پرسش‌های طولانی و نگارش خلاقانه نیز رتبه نخست گزارش‌شده را دارد و در حوزه‌های حرفه‌ای و چند زبان جایگاه بالایی گرفته. با این حال، در Code Arena: WebDev با ۱۶۷۹ امتیاز هشتم شده.

در جمع‌بندی Gemini 4 Argon از نظر قیمت به عملکرد در Text Arena مرز کارایی را جابه‌جا کرده و با نرخ ترکیبی ۸ دلار برای هر میلیون توکن، اقتصادی‌ترین مدل معرفی شده. با این حال نرم‌افزار پیرامون مدل بر تجربه کاربری اثر دارد و اپلیکیشن Gemini در مقایسه با Claude Cowork و ChatGPT Work عقب‌تر ارزیابی شده. Argon مدل فرانتیر گوگل پس از بیش از هفت ماه است؛ جمنای ۳.۵ فرانتیر نیز کنار گذاشته شد.

منبع ۱ | منبع ۲

پوریا | ۱۶ ساعت پیش

دیدگاهتان را بنویسید