
گوگل Gemini 4 Argon را با تمرکز بر استدلال عمیق، مهندسی نرمافزار و امنیت سایبری معرفی کرد
گوگل از Gemini 4 Argon بهعنوان مدل جدید فرانتیر خود رونمایی کرده؛ مدلی که فعلاً از طریق برنامه Fairwind در اختیار گروهی از مدافعان مورداعتماد حوزه امنیت سایبری قرار میگیرد و برای استدلال عمیق در فرایندهای طولانی و پیچیده طراحی شده. این مدل در مهندسی نرمافزار، کارهای سازمانی مانند امور حقوقی و مالی و دفاع سایبری تمرکز دارد و با رویکرد عرضه مرحلهای ارائه میشود.
گوگل میگوید Gemini 4 Argon پیش از عرضه عمومی در حال استفاده داخلی است و هزاران کارمند برای کدنویسی تخصصی، پژوهش عمیقتر و نگارش از آن استفاده کردهاند. در یک نمونه، مدل منابع زمانی و فضایی الگوریتمهای کوانتومی را بهینه کرد و نتیجهای ۴۰ درصد بهتر از خط مبنای منتشرشده به دست آورد. تحلیل دادههای مراکز داده نیز بیش از ۳۰۰ ترابایت حافظه آزاد کرده و صرفهجویی نهایی ۵۰۰ ترابایت تا یک پتابایت برآورد شده است.

گوگل Gemini 4 Argon برای مهاجرت کدهای C و C پلاس پلاس به Rust در پروژههای گوگل به کار گرفته میشود؛ از کتابخانههایی مانند re2 و libgav1 تا بیش از ۸۰۰ هزار خط کد در هسته Fuchsia Zircon؛ گوگل میگوید این بازنویسیهای حساس پیش از تولید، حسابرسی خودکار و دستی، آزمایش شبیهسازی و بازبینی میشوند. در libgav1 نیز ۳۲ هزار خط SIMD با Rust ایمن جایگزین و رمزگشای ویدیو ۲.۷ برابر سریعتر شده.
یکی از تغییرات مهم Gemini 4 Argon افزایش سقف خروجی از ۶۴ هزار به یک میلیون توکن است؛ رقمی که گوگل آن را رکوردی در صنعت میداند. این ظرفیت به مدل اجازه میدهد در یک مسیر طولانی، صدها هزار توکن تولید کند و مسائل دشوار را عمیقتر بررسی کند. پنجره ورودی نیز یک میلیون توکن باقی مانده است. Gemini 4 Argon متن، تصویر، ویدیو و صدا را دریافت میکند اما خروجی آن فقط متنی است.
در ارزیابیهای معرفیشده Argon در DeepSWE v1.1 به امتیاز ۷۷.۹ درصد رسیده و گوگل آن را برای مهندسی نرمافزار واقعی و طولانیمدت در سطحی پیشرو معرفی میکند. این مدل در Vals Index نیز جایگاه نخست را دارد؛ شاخصی که اثر اقتصادی کارهای مالی، کدنویسی، حقوقی و مالیاتی را با وزندهی بر اساس سهم آنها از تولید ناخالص داخلی آمریکا میسنجد. در Vals Finance Agent v2 و ارزیابی حقوقی Harvey نیز عملکرد پیشرو گزارش شده است.








در AutomationBench متعلق به Zapier مدل Gemini 4 Argon امتیاز ۵۱.۳ درصد و رتبه نخست را ثبت کرده. درک بصری نیز از قابلیتهای مورد تأکید گوگل است؛ مدل میتواند نمودارهای حرفهای را تحلیل کند، جزئیات ویدیوهای طولانی را تشخیص دهد و بر پایه اسناد اقدام کند. در LVBench که درک ویدیوهای طولانی را میسنجد، امتیاز ۹۱.۷ درصد برای Argon گزارش شده. در امنیت سایبری نیز مدل قادر به یافتن، اعتبارسنجی و وصله آسیبپذیریهای مهم است.
مدل Gemini 4 Argon در برنامه Scan for Good شرکت Wiz برای دفاع رایگان از زیرساختهای عمومی حیاتی به کار گرفته شده و طبق گزارش، یک آسیبپذیری مهم را در نرمافزارهای درمانی بیمارستانهای سراسر جهان کشف کرده. این نقص میتوانست اطلاعات شخصی حساس را در معرض خطر قرار دهد. در CWE-bench v1، Argon با امتیاز ۶۸ درصد در جایگاه نخست مشترک قرار گرفته.
عرضه گسترده این مدل هنوز آغاز نشده و گوگل پیش از آن روی ایمنی تمرکز دارد. مدل برای مقابله با سوءاستفادههای سایبری و حملات CBRN از درخواستهای مخرب خودداری میکند و پژوهشهای علمی دوکاربردی مشروع را حفظ میکند. نظارت بر فعالسازیهای داخلی برای شناسایی سوءاستفاده تقویت شده و آزمون تیمهای قرمز انجام شده. Argon در برابر تزریق غیرمستقیم فرمان نیز با آموزش خصمانه و آزمون خودکار، در معیار IPI شرکت Gray Swan عملکرد پیشرو دارد.
مقایسه عملکرد Gemini 4 Argon با دیگر رقبا:
از نظر جایگاه محصول Gemini 4 Argon در منبع حاضر مدلی کاملاً عمومی نیست و فعلاً برای مدافعان مورداعتماد سایبری عرضه میشود. گوگل میگوید توسعه دسترسی بهصورت مرحلهای انجام خواهد شد و بازخورد کاربران اولیه برای بهبود سازوکارهای ایمنی به کار میرود. این شرکت در فرایند داوطلبانه دولت آمریکا برای دسترسی پیش از عرضه نیز مشارکت دارد و قصد دارد پس از آن، مدل را به توسعهدهندگان، سازمانها و مصرفکنندگان ارائه کند.
قیمت معرفیشده برای Gemini 4 Argon برابر با ۲ دلار به ازای هر یک میلیون توکن ورودی و ۱۰ دلار برای هر یک میلیون توکن خروجی است. ورودیهای کششده نیز ۹۵ درصد ارزانتر محاسبه میشوند؛ یعنی حدود ۰.۱۰ دلار برای هر میلیون توکن. پس از دوره معرفی، قیمت به ۴ دلار برای ورودی و ۲۰ دلار برای خروجی میرسد. در جدول، GPT-6 Astra برابر ۱۰ و ۵۰ دلار قیمتگذاری شده است.
در بخش هزینه کش جدول منبع برای GPT-6 Astra رقم یک دلار، برای Claude Fable 5.1 رقم ۰.۲۵ دلار و برای Claude Opus 5.5 رقم ۰.۲۰ دلار به ازای هر میلیون توکن نشان میدهد. هزینه نوشتن کش برای GPT-6 Astra برابر ۱۲.۵ دلار، برای Fable 5.1 بین ۱۲.۵ تا ۲۰ دلار و برای Opus 5.5 بین ۵ تا ۸ دلار ذکر شده؛ هرچند برای Gemini 4 Argon هزینه نوشتن کش اعلام نشده.
یکی از نکات فنی مهم افزایش سقف خروجی از ۶۴ هزار به یک میلیون توکن است؛ قابلیتی که گوگل آن را نخستین نمونه در صنعت معرفی میکند. برای جلوگیری از توقف پاسخهای طولانی، Gemini API قابلیت Long Decode Continuation را اضافه میکند تا پاسخ متوقف شود و با درخواستهای بعدی ادامه پیدا کند. پنجره زمینه ورودی نیز یک میلیون توکن است و مدل متن، تصویر، ویدیو و صدا را میپذیرد، اما فقط متن تولید میکند.
ارزیابی مستقل Artificial Analysis تصویر متعادلتری از عملکرد Argon ارائه میدهد؛ این مدل در بالاترین سطح استدلال High امتیاز ۵۳ در Intelligence Index گرفته و با GPT-6 Astra و Claude Fable 5.1 برابر شده و GPT-6.1 Sol یک امتیاز پایینتر دارد؛ Claude Opus 5.5 با ۵۸ و Claude Sonnet 5.5 با ۵۶ امتیاز بالاتر قرار گرفتهاند. Argon نسبت به Gemini 3.1 Pro Preview نیز ۲۳ امتیاز رشد کرده.

از نظر هزینه هر وظیفه در Intelligence Index اجرای Gemini 4 Argon با قیمت تبلیغاتی حدود ۱.۹۹ دلار برآورد شده که ۶۰ درصد هزینه GPT-6 Astra و ۲.۷ برابر GPT-6.1 Sol است. پس از پایان تخفیف هزینه به حدود ۳.۹۸ دلار میرسد و حدود ۲۰ درصد بیشتر از Astra خواهد بود. مزیت فعلی بیشتر از نرخ پایین توکن میآید زیرا Gemini 4 Argon بهطور متوسط ۶۲ هزار توکن خروجی مصرف میکند، در برابر ۲۷ هزار توکن برای Astra.
مدل هوش مصنوعی Gemini 4 Argon گوگل در AutomationBench-AA به ۷۷.۵ درصد رسیده و در منبع شش امتیاز بالاتر از Claude Sonnet 5.5 معرفی شده. در Terminal Bench 4 نیز امتیاز ۵۷ درصد دارد که نسبت به Gemini 3.1 Pro Preview جهشی ۵۳ امتیازی است اما پایینتر از Sonnet 5.5 با ۶۴، Opus 5.5 با ۶۰ و GPT-6 Astra با ۵۹ درصد قرار میگیرد؛ در AA-Omniscience نرخ توهم ۱۵ درصد گزارش شده.
در AA-Omniscience دقت Argon به ۵۰ درصد رسیده؛ پنج امتیاز پایینتر از Gemini 3.1 Pro Preview و ۱۳ امتیاز کمتر از GPT-6 Astra با ۶۳ درصد. امتیاز کلی آن ۴۲ است، در برابر ۴۳ برای Astra و ۴۲ برای GPT-6.1 Sol؛ Vals AI امتیاز ۶۸.۹ درصد و جایگاه نخست را به Argon داده و آن را در ۲۰ مورد از ۲۲ ارزیابی در پنج رتبه قرار داده است.
در Arena.ai، مدل Gemini 4 Argon در Text Arena با ۱۵۲۵ امتیاز اول شده و ۲۰ امتیاز بالاتر از Claude Opus 4.6 قرار گرفته؛ این مدل در کدنویسی، پرسشهای دشوار، پیروی از دستورها، پرسشهای طولانی و نگارش خلاقانه نیز رتبه نخست گزارششده را دارد و در حوزههای حرفهای و چند زبان جایگاه بالایی گرفته. با این حال، در Code Arena: WebDev با ۱۶۷۹ امتیاز هشتم شده.
در جمعبندی Gemini 4 Argon از نظر قیمت به عملکرد در Text Arena مرز کارایی را جابهجا کرده و با نرخ ترکیبی ۸ دلار برای هر میلیون توکن، اقتصادیترین مدل معرفی شده. با این حال نرمافزار پیرامون مدل بر تجربه کاربری اثر دارد و اپلیکیشن Gemini در مقایسه با Claude Cowork و ChatGPT Work عقبتر ارزیابی شده. Argon مدل فرانتیر گوگل پس از بیش از هفت ماه است؛ جمنای ۳.۵ فرانتیر نیز کنار گذاشته شد.




