
معرفی Gemini 4 Argon؛ قدرتمندترین مدل گوگل که فعلا در دسترس عموم نیست
یه زمانی شرکتهای هوش مصنوعی هر چند هفته یه مدل جدید میدادن بیرون و همه میرفتن سراغش. حالا اما رسیدیم به جایی که مدلها اونقدر قدرتمند شدن که قبل از رسیدن به دست عموم، باید کلی تست و گاردریل روشون سوار بشه. همین اتفاق برای Claude Mythos افتاد و حالا نوبت گوگله. Gemini 4 Argon معرفی شده و شما فعلا اجازه استفاده ازش رو ندارید. با بنچفا تا پایان این مطلب همراه باشید.
Gemini 4 Argon چیه و چرا در دسترس عموم نیست؟
گوگل این مدل رو به عنوان جدیدترین مدل فرانتیر خودش معرفی کرده، ولی توی داشبورد شخصی Gemini پیداش نمیکنید. دلیلش هم سادهست: به گفته گوگل این مدل برای عرضه عمومی یهکم زیادی قدرتمنده.
توی بیانیه رسمی گوگل اومده:
امروز از مدل فرانتیر جدیدمون، Gemini 4 Argon، رونمایی میکنیم که از طریق برنامه Fairwind در حال عرضه به مجموعهای از مدافعان سایبری مورد اعتماده. Argon برای حفظ استدلال عمیق در طول جریانهای کاری پیچیده و طولانیمدت ساخته شده و به شکل بنیادی داره روش کار و ساخت ما در گوگل رو تغییر میده. این مدل عملکرد سطح فرانتیر رو در جریانهای کاری پیچیده ارائه میده؛ از مهندسی نرمافزار در دنیای واقعی گرفته تا کارهای دانشی سازمانی مثل حقوق و مالی، و دفاع سایبری.
عرضه ایمن قابلیتهایی در این سطح، نیازمند یک رویکرد مرحلهایه. ما به شکل فعال در فرآیند داوطلبانه دولت ایالات متحده برای دسترسی پیش از انتشار به مدل مشارکت داریم و همزمان به تدریج دسترسی رو گسترش میدیم. ما به جمعآوری بازخورد از تسترهای اولیه ادامه میدیم و روی گاردریلها کار میکنیم تا در اسرع وقت Argon رو در اختیار توسعهدهندگان، سازمانها و مصرفکنندگان قرار بدیم.
نکته مهم اینه که ما دیگه به نقطهای رسیدیم که مدلهای هوش مصنوعی تهدید جدیای برای اینترنت به حساب میان. قبلا دیدیم که چند مدل مختلف، از جمله خود Gemini، از محدودههای تعیینشده خارج شدن و برای رسیدن به هدفشون به سرور شرکتهای دیگه نفوذ کردن. دادن همین مدلها دست مجرمهای بالقوه، عملا یعنی دعوت کردن از دردسر.
تدابیر امنیتی گوگل برای جلوگیری از سوءاستفاده
گوگل توی بخش ایمنی بیانیهاش به شکل مشخص به این موضوع اشاره کرده:
دفاع در برابر سوءاستفاده: برای جلوگیری از استفاده بازیگران بد از Argon برای حملات سایبری یا حملات شیمیایی، بیولوژیکی، رادیولوژیکی و هستهای (CBRN)، این مدل طوری طراحی شده که درخواستهای مخرب رو رد کنه و در عین حال تحقیقات علمی مشروع و دومنظوره رو حفظ کنه؛ مطابق با چارچوب ایمنی فرانتیر ما. ما داریم استحکام سازوکارهای محافظتی خودمون رو برای این عرضه تقویت میکنیم، از جمله بهبود تکنیکهامون برای مانیتور کردن فعالسازیهای داخلی مدل به منظور تشخیص سوءاستفاده.
در کنارش گوگل روی سه محور دیگه هم کار کرده: مقاومت در برابر حملات پرامپت اینجکشن غیرمستقیم، مانیتور کردن زنجیره فکری مدل برای تشخیص ناهمراستایی (Misalignment) و متوقف کردن اجرا در صورت لزوم، و سختتر کردن محیطهای سندباکس قبل از شروع آموزش یا ارزیابیهای پرریسک.
یه نکته جالب که خود گوگل بهش اشاره کرده اینه که موقع مانیتور کردن رانهای آموزشی، عمدا یافتهها رو به چرخه آموزش برنمیگردونن؛ چون این کار ممکنه باعث بشه مدل یاد بگیره چطوری از دست مانیتورینگ فرار کنه. گوگل از بقیه صنعت هم خواسته که شفافیت استدلال مدلها رو حفظ کنن.
در حال حاضر این مدل از طریق برنامه Fairwind در اختیار مدافعان سایبری مورد اعتماد قرار میگیره. برای این گروه و تیمهای داخلی خود گوگل، Argon بدون گاردریلهای سایبری عرضه میشه تا بتونن از کل توان دفاعی مدل استفاده کنن.
عملکرد Gemini 4 Argon در بنچمارکها؛ مقایسه با GPT-6 Astra و Claude Opus 5.5
اینجا جاییه که برای ما جالب میشه، چون بالاخره عدد داریم. گوگل ادعا نمیکنه که Argon تو همه بنچمارکها برندهست، ولی توی جدول ۱۸ بنچمارکی که منتشر کرده، Argon تو ۱۲ مورد به تنهایی جلوئه و تو ۱ مورد هم رتبه اول رو شریکه. GPT-6 Astra تو ۳ مورد به تنهایی جلوئه و یه مورد هم با Argon مساویه. Claude Opus 5.5 هم تو ۲ مورد صدرنشینه.
| بنچمارک | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|---|
| Harvey Legal Agent | 19.6% | 5.4% | 3.8% |
| AutomationBench | 51.3% | 41.4% | 42.5% |
| GraphWalks (long) | 84.2% | 71.8% | 66.8% |
| Vals Finance Agent v2 | 65.4% | 53.5% | 58.6% |
| DeepSWE v1.1 | 77.9% | 74.1% | 74.2% |
| LVBench | 91.7% | 87.5% | 83.7% |
| CWE-bench v1 | 68% | 68% | 67% |
| FrontierSWE v2 | 55.0% | 65.5% | — |
| Terminal-Bench Science 0.1 | 57.6% | 68.1% | — |
| Terminal-bench 4.0 | 57.4% | — | 66.4% |
| PostTrainBench | 45.3% | — | 49.3% |
بزرگترین برتریهای Argon تو کارهای سازمانی و کانتکستهای طولانیه. اختلاف ۱۹.۶٪ به ۵.۴٪ تو بنچمارک حقوقی Harvey واقعا فاصلهی عجیبیه.
منتها اون سه ردیف آخر جدول رو نادیده نگیرید. GPT-6 Astra تو FrontierSWE v2 و Terminal-Bench Science 0.1 با اختلاف ۱۰.۵ واحد درصدی از Argon جلوتره و Claude Opus 5.5 تو Terminal-bench 4.0 با ۹ واحد درصد اختلاف صدرنشینه. یعنی ادعای «بهترین مدل دنیا» نه، ولی «مدلی که تو بیشترین تعداد دستهبندی اوله» آره.
یه نکته دیگه هم هست: تو بنچمارک Gray Swan که مقاومت در برابر پرامپت اینجکشن غیرمستقیم رو میسنجه، Argon با نرخ موفقیت حمله ۰.۷٪ اول شده. Claude Opus 5.5 و Claude Fable 5.1 روی ۱٪، GPT-6 Astra روی ۸.۵٪، GPT-6 Sol روی ۲۷٪، GLM 5.3 روی ۳۱.۵٪ و Grok 4.8 روی ۵۱.۸٪ قرار دارن. این عدد آخری واقعا نگرانکنندهست.









سقف ۱ میلیون توکن خروجی؛ مهمترین تغییر عملی
اگه بخوایم یه تغییر رو به عنوان مهمترین دستاورد این مدل انتخاب کنیم، به نظر ما همینه. گوگل سقف توکن خروجی رو از ۶۴ هزار به ۱ میلیون توکن رسونده.
چرا مهمه؟ چون تو کارهای ایجنتیک مثل مهندسی نرمافزار، مهاجرت کدبیس، ممیزی و بازبینی حقوقی، ارزش یه مدل به این بستگی داره که چقدر میتونه یه زنجیره کاری رو ادامه بده بدون اینکه مجبور بشه کنترل رو به آدم پس بده. با هد روم بیشتر، مدل میتونه یه مسئله سخت رو تو یه رفتوبرگشت حل کنه به جای ده تا.
Argon در داخل گوگل چه کارهایی انجام داده؟
گوگل میگه هزاران کارمندش همین الان دارن از Argon برای کدنویسی تخصصی، تحقیق و نوشتن استفاده میکنن. چند نمونهای که منتشر کرده:
بهینهسازی الگوریتم کوانتومی: Argon به محققهای کامپیوتر کوانتومی گوگل کمک کرده منابع فضازمان (کیوبیت × گیت) زیرروالهایی که گلوگاه محسوب میشدن رو بهینه کنن. تو یه نمونه، ظرف چند دقیقه ۴۰٪ بهتر از خط پایه منتشرشده عمل کرده.
بهینهسازی حافظه: یه تیم از ایجنتهای Argon تلهمتری پروفایلینگ کل ناوگان سرورها رو تحلیل کرده و به شکل خودکار بهینهسازیهایی رو شناسایی و اعمال کرده که بعد از پیادهسازی کامل، بیش از ۳۰۰ ترابایت (TiB) حافظه آزاد میکنه. تخمین کل صرفهجویی بین ۵۰۰ ترابایت تا ۱ پتابایته.
مهاجرت کدبیس از C/C++ به Rust: این پروژه از دهها هزار خط کد تو کتابخونههای اصلی مثل re2 و libgav1 شروع شده و تا بیش از ۸۰۰ هزار خط برای کرنل Zircon سیستمعامل Fuchsia ادامه پیدا میکنه. گوگل تأکید کرده که به خاطر حساسیت این سیستمها، همه این بازنویسیها قبل از رفتن روی پروداکشن، ممیزی خودکار و دستی، تست شبیهسازی و بازبینی سختگیرانه رو رد میکنن.
ملموسترین نمونه مهندسی، همون libgav1 یا دیکودر ویدیوی متنباز گوگله. ایجنتهای Argon یه پورت Rust موجود رو برداشتن و ۳۲ هزار خط کد SIMD رو جایگزین کردن؛ اون هم با اجرای چندین دور آزمایش مبتنی بر پروفایل و بررسی خروجی کامپایلر، تا کدی تولید کنن که خود کامپایلر به صورت خودکار وکتورایزش کنه. نتیجه یه دیکودر ویدیوی ایمن از نظر حافظهست که ۲.۷ برابر سریعتر از پورت Rust قبلی کار میکنه، با خروجی ویدیویی کاملا یکسان.
دفاع سایبری؛ جدیترین ادعای گوگل
گوگل میگه Argon میتونه به شکل خودمختار آسیبپذیریهای نرمافزاری حیاتی رو پیدا کنه، اعتبارسنجی کنه و پچ بزنه. شرکت Wiz همین الان داره از این مدل توی ابتکار Scan for Good استفاده میکنه؛ برنامهای که هدفش محافظت رایگان از زیرساختهای عمومی حیاتیه.
طبق گزارش گوگل، این مدل یه آسیبپذیری بحرانی رو تو نرمافزارهای حوزه سلامت که توی بیمارستانهای سراسر دنیا استفاده میشه کشف کرده؛ آسیبپذیریای که اطلاعات شخصی حساس رو در معرض خطر قرار میداده و مدلهای فرانتیر قبلی از قلم انداخته بودنش.
قیمتگذاری و زمان عرضه عمومی Gemini 4 Argon
قیمتگذاری معرفی این مدل تهاجمیه. Argon با قیمت ۲ دلار به ازای هر یک میلیون توکن ورودی و ۱۰ دلار به ازای هر یک میلیون توکن خروجی عرضه میشه و توکنهای ورودی کششده با ۹۵٪ تخفیف قیمتگذاری میشن؛ یعنی حدود ۰.۱۰ دلار به ازای هر میلیون توکن.
بعد از دوره معرفی، قیمت به ۴ دلار ورودی و ۲۰ دلار خروجی میرسه. برای مقایسه:
| مدل | ورودی (هر ۱M توکن) | خروجی (هر ۱M توکن) |
|---|---|---|
| Gemini 4 Argon (معرفی) | $2 | $10 |
| Gemini 4 Argon (عادی) | $4 | $20 |
| Claude Opus 5.5 | $4 | $20 |
| GPT-6 Astra | $10 | $50 |
یعنی Argon تو دوره معرفی یکپنجم قیمت GPT-6 Astra و نصف قیمت Claude Opus 5.5 تموم میشه. بعد از دوره معرفی هم دقیقا همقیمت Opus 5.5 میشه و همچنان از Astra ارزونتره. البته گوگل نگفته این دوره «معرفی» قراره چقدر طول بکشه و تجربه نشون داده که بعضی وقتها همین قیمت معرفی تا ابد میمونه.
چرا این عرضه برای گوگل انقدر مهمه؟
یکم پسزمینه لازمه. گوگل از آخرین فلگشیپش یعنی سری Gemini 3 در نوامبر ۲۰۲۵ تا حالا مدل پرچمدار جدیدی نداده بود، در حالی که OpenAI با GPT-6 و Anthropic با نسخههای جدیدتر Claude جلو رفته بودن.
این فاصله با چند ماه فشار عمومی همراه بود. تو جولای، نگرانی سرمایهگذارهای Alphabet درباره تأخیر عرضه Gemini 3.5 Pro، بالا رفتن هزینه زیرساخت هوش مصنوعی و خروج نیرو از تیمهای AI مطرح شد. تو آگوست هم یه جابهجایی بزرگ در رهبری اتفاق افتاد: دمیس هسابیس از سمت مدیرعاملی Google DeepMind کنار رفت و به عنوان رئیس هیئتمدیره و دانشمند ارشد Alphabet مشغول شد، جف دین نقش دانشمند ارشد رو رها کرد تا با چند محقق دیگه شرکت تأسیس کنه، و کورای کاووکچواوغلو به سمت اصلی DeepMind رسید که مستقیم به ساندار پیچای گزارش میده.
پس Argon فقط یه عرضه مدل نیست؛ جواب گوگله به این روایت که نیمکت تیم AI این شرکت عمیقه ولی ریتم عرضه محصول فرانتیرش از دست رفته.
کلام آخر: Argon واقعا گوگل رو به صدر برگردونده؟
اگه صرفا تعداد صدرنشینی تو بنچمارکها ملاک باشه، بله. ۱۲ صدرنشینی مطلق و ۱ تساوی از ۱۸ بنچمارک، بهترین کارنامهای بود که گوگل تو ماههای اخیر ارائه داده. سقف ۱ میلیون توکن خروجی و قیمت نصف Opus 5.5 هم دو تا برگ برندهی واقعین، نه صرفا عدد روی کاغذ.
پاشنه آشیل ماجرا اما دسترسیه. شما نمیتونید این مدل رو تست کنید. نه شما، نه اکثر توسعهدهندهها. تا وقتی مدل فقط دست مدافعان سایبری منتخب باشه، هیچکس نمیتونه بررسی کنه که این اعداد تو بار کاری واقعی هم همینقدر خوب ظاهر میشن یا نه. بنچمارک یه چیزه و رفتار پایدار تو پروداکشن یه چیز دیگه.
ما فعلا این رو یه اعلام موضع قوی از طرف گوگل میبینیم که اثباتش موکول شده به زمانی که واقعا دستمون بهش برسه. تا اون موقع، اون سه تا بنچمارکی که Argon توشون عقبه هم به همون اندازهی دوازده تا برد بقیه خبر دارن.
بیانیه کامل گوگل رو میتونید توی بلاگ رسمی این شرکت بخونید.
نظر شما درباره Gemini 4 Argon چیه؟ به نظرتون سیاست عرضه مرحلهای درسته یا شرکتها دارن از بحث ایمنی برای موجه جلوه دادن تأخیرهاشون استفاده میکنن؟ تو کامنتها بهمون بگید.





