گوگل از Gemini 4 Argon رونمایی کرد و آن را آغازگر عصر بعدی هوش پیشرفته میداند. مدل جدید برای استدلال عمیق در کارهای پیچیده و طولانیمدت ساخته شده و شیوهی نامگذاری جدیدی دارد. معرفی آرگون پس از لغو Gemini 3.5 Pro و تمرکز گوگل بر Gemini 3.8 Flash انجام میشود.
گوگل میخواهد با مدل تازه تواناییهایی در سطح مدلهای پیشرو را در حوزههای برنامهنویسی، دانش، دفاع سایبری و نویسندگی عرضه کند. سقف خروجی جمنای ۴ آرگون به یک میلیون توکن رسیده، درحالیکه محدودیت قبلی ۶۴ هزار توکن بود. تواناییهای گستردهتر در برنامهنویسی، استدلال و پردازش چندوجهی نیز مدل را برای کاربردهای طولانیتر و پیچیدهتر آماده میکنند.
قابلیت تفکر عمیق و تولید صدها هزار توکن در یک مسیر پیوسته
گوگل میگوید فراهمشدن فضای کافی برای تفکر عمیق و تولید صدها هزار توکن در یک مسیر پیوسته، سطح تازهای از عمق استدلال را در اختیار مدل میگذارد. آرگون به کمک چنین ظرفیتی میتواند مسائل دشوار را در یک نوبت بررسی و حل کند. نتایج بنچمارکهای منتشرشده نیز بخشی از پیشرفت مدل را نشان میدهند.
Gemini 4 Argon در DeepSWE v1.1 امتیاز ۷۷٫۹ درصد را کسب کرده است. Claude Opus 5.5 با امتیاز ۷۴٫۲ درصد در جایگاه بعدی قرار دارد و GPT-6 Astra نیز به امتیاز ۷۴٫۱ درصد دست یافته است. برتری Argon در ارزیابی یادشده، ادعای گوگل دربارهی توانایی پیشرفتهی مدل در برنامهنویسی را تقویت میکند.
گوگل جمنای ۴ آرگون را برای برخورداری از توانایی بالا در دفاع سایبری آموزش داده و از جهش عملکردش نسبتبه Gemini 3.8 Flash Cyber خبر میدهد. نسخهی بدون محدودیتهای محافظتی سایبری در اختیار افراد مورداعتماد و تیمهای داخلی گوگل قرار خواهد گرفت تا بتوانند از تمام ظرفیت مدل برای دفاع سایبری بهره ببرند.
آرگون در بنچمارک CWE-bench v1 که توانایی مدل در اصلاح آسیبپذیریهای امنیتی را ارزیابی میکند، با امتیاز برتر ۶۸ درصد بهطور مشترک در رتبهی نخست قرار گرفت.
تواناییهای جمنای ۴ آرگون به برنامهنویسی و امنیت محدود نیستند
تواناییهای مدل به برنامهنویسی و امنیت محدود نمیشوند و گوگل از عملکرد پیشرو در ارزیابیهای تخصصی حوزههای دیگر نیز سخن میگوید. نمونههای مطرحشده شامل Vals Finance Agent v2 برای پژوهش مالی چندمرحلهای و Harvey's Legal Agent Benchmark برای پژوهش و نگارش حقوقی هستند.
آرگون در AutomationBench، بنچمارک زپیر برای سنجش اجرای سرتاسری وظایف اصلی کسبوکار، با امتیاز ۵۱٫۳ درصد رتبهی نخست را به دست آورد. مدل گوگل در LVBench نیز که درک ویدئوهای طولانی را اندازهگیری میکند، با امتیاز ۹۱٫۷ درصد به بهترین عملکرد روز رسیده است.
عرضهی جمنای ۴ آرگون بهزودی آغاز میشود و مشترکان Google AI Ultra و مشتریان پولی API نخستین گروههای دریافتکنندهی آن خواهند بود. قیمت اولیهی مدل به ازای هر یک میلیون توکن ورودی ۲ دلار و برای هر یک میلیون توکن خروجی ۱۰ دلار تعیین شده است.
توکنهای ورودی ذخیرهشده در کش با تخفیف ۹۵ درصدی نسبت ه قیمت توکن ورودی محاسبه میشوند. پس از پایان دورهی مقدماتی، هزینهی هر یک میلیون توکن ورودی به ۴ دلار و هر یک میلیون توکن خروجی به ۲۰ دلار افزایش مییابد.
امنیت، اولویت اصلی گوگل در انتشار جمنای ۴ آرگون است
گوگل تاکنون جمنای ۴ آرگون را از طریق برنامهی Fairwind در اختیار آزمایشکنندگان مورداعتماد و مدافعان سایبری گذاشته است. پیش از عرضهی گستردهتر، تلاشها بر جلوگیری از سوءاستفادههای مرتبط با حملات سایبری و تهدیدهای شیمیایی، زیستی، پرتوی و هستهای موسوم به CBRN متمرکز شدهاند. گوگل همچنین روشهای نظارت بر فعالسازیهای داخلی مدل را بهبود داده تا نشانههای سوءاستفاده را شناسایی کند.
مقاومترین هوش مصنوعی گوگل در برابر تزریق غیرمستقیم پرامپت
مقاومت در برابر حملات تزریق پرامپت یکی دیگر از محورهای ایمنی بهشمار میرود و گوگل آرگون را مقاومترین مدل خود در برابر تزریق غیرمستقیم پرامپت توصیف میکند. مدل در Gray Swan's Indirect Prompt Injection Benchmark یا IPI نیز از نظر استحکام در برابر تزریق پرامپت عملکردی پیشرو داشته است.
گوگل همزمان محیطهای سندباکس خود را پیش از آغاز آموزشها یا ارزیابیهای پرخطر جداسازی و مهروموم میکند تا سامانهها سختتر و ایمنتر شوند.
راهکارهای کاهش ناهمراستایی نیز زنجیرهی تفکر و اقدامات آرگون را زیر نظر میگیرند و در صورت لزوم اجرای مدل را متوقف میکنند. گوگل از سامانهای مشابه برای نظارت بر فرایندهای آموزش و ارسال هشدار به تیم اختصاصی واکنش به رخداد استفاده کرده است. یافتههای نظارتی با احتیاط به فرایند آموزش بازگردانده نمیشوند تا خطر شکلگیری استدلالی که بتواند نظارت را دور بزند، کاهش یابد.
Gemini 4 Argon هماکنون بخشی از جریانهای کاری داخلی گوگل را پیش میبرد و هزاران نفر از کارکنان گوگل نقاط قوت آن را در وظایف تخصصی برنامهنویسی، انجام پژوهشهای عمیقتر و تولید نوشتههای باکیفیت برجسته کردهاند.
عاملهای Argon در مهاجرت و بهینهسازی کدبیسهای بزرگ نیز به کار گرفته شدهاند و انتقال کدهای C++/C گوگل به Rust را پیش میبرند. مقیاس پروژهها از دهها هزار خط در کتابخانههای اصلی مانند re2 و libgav1 شروع میشود و در کرنل Zircon سیستمعامل Fuchsia به بیش از ۸۰۰ هزار خط میرسد.
بهدلیل حساسیت بسیاری از سامانههای هدف، بازنویسیهای گسترده پیش از ورود به محیط عملیاتی تحت ممیزیهای دقیق خودکار و دستی، آزمایشهای شبیهسازی و بررسی تخصصی قرار میگیرند.
در پروژهی libgav1، نرمافزار متنباز گوگل برای رمزگشایی ویدئو، عاملهای Argon کار را با نسخهی انتقالیافتهی موجود به Rust آغاز کردند. عاملها با اجرای دورهای متعدد آزمایشهای هدایتشده با دادههای پروفایل، بررسی خروجی کامپایلر و تولید کد ایمن Rust، جایگزینی ۳۲ هزار خط کد SIMD را ممکن کردند تا کامپایلر عملیات برداریسازی را بهصورت خودکار انجام دهد. نتیجه یک رمزگشای ویدیویی ایمن از نظر حافظه بود که خروجی ویدیویی کاملا یکسانی تولید میکند و ۲٫۷ برابر سریعتر از نسخهی انتقالیافتهی قبلی به Rust اجرا میشود. عملکرد نسخهی جدید نیز به پیادهسازی بهینهشدهی ++C نزدیکتر شده است.
نظر شما دربارهی تواناییها و قیمت جمنای ۴ آرگون چیست؟