گوگل رسما از Gemini 3.8 پرده برداشت؛ مدلی که هم‌زمان روی استدلال، کدنویسی و کارایی اقتصادی تمرکز دارد و در دو نسخه‌ی Flash و Flash Cyber ارائه می‌شود.

این سومین انتشار نسخه‌ی Flash در شش هفته‌ی گذشته است و گوگل می‌گوید 3.8 Flash را با همان سرعت و هزینه‌ی 3.7 Flash، اما با توان استدلال و کدنویسی بهتر، عرضه کرده است.

Google

بر اساس بیانیه‌ی مطبوعاتی گوگل، قیمت آغازین برای هر یک میلیون توکن ورودی ۰٫۷۵ دلار و برای هر یک میلیون توکن خروجی ۳٫۷۵ دلار اعلام شده؛ همان سطحی که برای 3.7 Flash هم در نظر گرفته شده بود.

پخش از رسانه

به روایت گوگل، 3.8 Flash برای کارهای طولانی‌مدت کدنویسی و عامل‌های خودمختار ساخته شده و در آزمون‌هایی مانند DeepSWE v1.1 عملکردی بالاتر از بیشتر مدل‌های بزرگ‌تر نشان می‌دهد. همچنین در بنچمارک‌هایی مثل Vals Finance Agent V2 و Harvey's Legal Agent Benchmark از 3.7 Flash و دیگر مدل‌های مرزی پیشی گرفته و روی HLE-Verified به ۵۴٫۹ درصد رسیده است؛ عددی که توانایی آن را در استدلال چندمرحله‌ای میان حوزه‌های STEM، علوم انسانی و حرفه‌ای نشان می‌دهد.

نمودار مقایسه هزینه و کارایی مدل‌های هوش مصنوعی از جمله جمنای ۳٫۸ فلش (Gemini 3.8 Flash)
نمودار میله‌ای مقایسه دقت مدل جمنای (Gemini 3.8 Flash) در وظایف تحلیلگر مالی
نمودار میله‌ای مقایسه دقت مدل‌های Gemini 3.8 Flash و Claude در بنچمارک حقوقی
نمودار میله‌ای مقایسه توانایی استدلال مدل جمنای ۳٫۸ فلش (Gemini 3.8 Flash) با سایر مدل‌های هوش مصنوعی
نتایج آزمون HLE-Verified که برتری مدل جدید گوگل در استدلال چندرشته‌ای را نسبت به رقبایی مانند Claude و GPT نشان می‌دهد.

گوگل دلیل اصلی این جهش را یک تصمیم طراحی توصیف می‌کند؛ 3.8 Flash «سخت‌تر کار می‌کند.» در وظایف پیچیده، مدل گام‌های استدلالی بیشتری اجرا می‌کند و ابزارها را به‌صورت تکراری فرا می‌خواند. همین رفتار، در برخی سناریوها مصرف توکن را بالا می‌برد. برای تیم‌هایی که همچنان روی بهره‌وری محاسباتی تمرکز دارند، «سطح‌های پایین‌تر تلاش» در دسترس مانده و 3.7 Flash هم همچنان برای بارهای کاری مبتنی بر بهره‌وری پشتیبانی می‌شود.

نسخه‌ی Cyber برای دفاع سایبری

در سوی دیگر، Gemini 3.8 Flash Cyber قرار دارد؛ مدلی که به‌گفته‌ی گوگل برای مدافعان مورد اعتماد و از مسیر Fairwind Program ارائه می‌شود. هدف اصلی این نسخه، توانمندسازی دفاع سایبری با سرعت Flash و هزینه‌ی پایین‌تر است، نه تقویت قابلیت‌های تهاجمی.

در بنچمارک استاندارد CyberGym برای کشف آسیب‌پذیری، این مدل به سطح مرزی رسید و از 3.5 Flash Cyber و حتی مدل‌های مرزی بزرگ‌تر بهتر عمل کرد.

گوگل همچنین یک ارزیابی داخلی روی ۲۰ زبان برنامه‌نویسی انجام داده و می‌گوید نرخ موفقیت مدل از ۷۰ درصد فراتر رفته است. تمرکز اصلی هم از ابتدا روی رفع آسیب‌پذیری بوده، نه بهره‌گیری از قابلیت‌های اکسپلویت.

نمودار میله‌ای مقایسه نرخ موفقیت حملات (ASR) مدل‌های مختلف هوش مصنوعی در بنچمارک Gray Swan IPI
نمودار مقایسه دقت و هزینه مدل‌های هوش مصنوعی جمنای (Gemini) در آزمون CWE-Bench
تحلیل عملکرد مدل جمنای ۳٫۸ فلش سایبر در مقایسه با سایر مدل‌های زبانی بر اساس دقت و هزینه اجرا.
نمودار میله‌ای مقایسه دقت مدل‌های Gemini 3.8 Flash Cyber و نسخه‌های قبلی در کشف آسیب‌پذیری
نتایج بنچمارک داخلی گوگل برای ارزیابی توانایی مدل‌های هوش مصنوعی در شناسایی آسیب‌پذیری‌های واقعی در ۲۰ زبان مختلف.
نمودار میله‌ای مقایسه دقت مدل Gemini 3.8 Flash Cyber در کشف آسیب‌پذیری‌های C/C++

در حوزه‌ی وصله‌نویسی خودکار نیز گوگل به CWE-Bench اشاره می‌کند؛ بنچمارکی که توسط Collinear اجرا می‌شود. در این آزمون، Gemini 3.8 Flash Cyber با pass@1 برابر با ۴۷٫۲ درصد در برابر مدل مرزی پیشرو با ۴۷٫۸ درصد قرار گرفته، اما با هزینه‌ای بسیار کمتر.

اثر عملی روی کدهای گوگل

گوگل می‌گوید همین حالا هم از Gemini 3.8 Flash Cyber برای ایمن‌سازی کدهای داخلی استفاده می‌کند. چند نمونه از نتایج منتشرشده، تصویر دقیق‌تری از کاربرد آن می‌دهند.

  • تیم امنیت کروم گزارش داده که 3.8 Flash Cyber در رفع آسیب‌پذیری‌های کروم، ۲٫۶ برابر وصله‌ی درست بیشتری نسبت به بهترین مدل‌های تجاری بسیار بزرگ تولید کرده است.
  • Wiz می‌گوید این مدل در بنچمارک داخلی تست نفوذ، ۷٫۵ تا ۹٫۷ درصد یادآوری بالاتری داشته و هم‌زمان ۲٫۳ تا ۵٫۲ برابر ارزان‌تر بوده است.
  • تیم Cloud Vulnerability Research گوگل با کمک همین مدل، یک آسیب‌پذیری بنیادی و مهم را در کمتر از ۲ ساعت پیدا کرده؛ کاری که معمولا ماه‌ها پژوهش و کشف می‌طلبد.

گوگل برای 3.8 Flash مجموعه‌ای از محافظت‌ها در برابر سوءاستفاده در نظر گرفته و در عین حال، استفاده‌های مفید را طبق چارچوب Frontier Safety Framework امکان‌پذیر نگه داشته است. نسخه‌ی Cyber اما مجموعه‌ای بازتر از سیستم‌ها را برای کاربردهای امنیتی در اختیار می‌گذارد و به همین دلیل فقط به مدافعان مورد اعتماد ارائه می‌شود که به قابلیت‌های گسترده‌تر نیاز دارند.

گوگل همچنین می‌گوید مدل‌های Gemini 3.8 در برابر حملات تزریق پرامپت مقاوم‌تر شده‌اند و طبق ارزیابی Gray Swan، کاربران را بهتر از حملات مخرب مبتنی بر تزریق فرمان محافظت می‌کنند.

دسترسی برای توسعه‌دهندگان، سازمان‌ها و کاربران عادی

گوگل مسیر دسترسی به دو مدل تازه را هم مشخص کرده است. توسعه‌دهندگان می‌توانند با 3.8 Flash در Google Antigravity کار کنند یا از طریق Gemini API در Google AI Studio و Android Studio توسعه را آغاز کنند. امکان تولید رابط کاربری در Stitch هم فراهم شده است.

برای سازمان‌ها، 3.8 Flash در Gemini Enterprise در دسترس قرار گرفته و کاربران عادی نیز می‌توانند از آن در Google AI Pro و Ultra از طریق اپ جمنای، AI Mode در موتور جست‌و‌جو و Gemini in Google Sheets استفاده کنند. دسترسی به 3.8 Flash Cyber هم از مسیر Fairwind Program برای مقام‌های دولتی مورد اعتماد، زیرساخت‌های حیاتی و نگه‌دارندگان نرم‌افزار به‌صورت اولویت‌دار ارائه می‌شود.

شما این جهش را چطور ارزیابی می‌کنید؟