تا همین چند وقت پیش، اگر از یک مدل هوش مصنوعی انتظار داشتید باگهای پروژه را پیدا کند، چند ابزار را پشتسرهم بهکار بگیرد یا در دل یک کدبیس بزرگ راهش را گم نکند، معمولاً باید بهسراغ مدلهای گرانتر و پرچمدار میرفتید. مدلهای سریعتر و ارزانتر اغلب برای خلاصهسازی، ترجمه یا پاسخهای سادهتر ساخته شده بودند؛ نه برای کاری که نیاز به برنامهریزی چندمرحلهای دارد.
حالا گوگل با معرفی Gemini 3.7 Flash میخواهد این مرز را کمی جابهجا کند. مدل جدید که تنها سه هفته بعد از Gemini 3.6 Flash از راه رسیده، همچنان در ردهی Flash قرار دارد؛ یعنی برای استفاده پرتکرار و مقیاسپذیر طراحی شده است. بااینحال، گوگل میگوید توانایی آن در کدنویسی، استفاده از ابزارها و انجام گردشکارهای عاملمحور بهطور محسوسی بهتر شده است.
در این مقاله، جمنای ۳٫۷ فلش را از زاویهی مشخصات و عملکرد واقعی بررسی میکنیم، نتایج آن را در برابر نسل قبل و چند رقیب مهم میگذاریم و در نهایت میبینیم که آیا این مدل واقعاً میتواند جای مدلهای گرانتر را در پروژههای جدی بگیرد یا نه.
جمنای ۳٫۷ فلش چیست و چرا مهم است؟
گوگل در ۱۳ آگوست ۲۰۲۶ (۲۲ مرداد) از Gemini 3.7 Flash رونمایی کرد؛ تنها حدود سه هفته پس از عرضه Gemini 3.6 Flash. نسخه جدید بهعنوان مدل سریع و کاربردی خانواده Gemini 3 برای کدنویسی، توسعه نرمافزار، انجام وظایف چندمرحلهای و گردشکارهای مبتنیبر عاملهای هوش مصنوعی معرفی شده است.
گوگل میگوید مدل جدید بر پایهی جمنای ۳٫۶ فلش ساخته شده و با بهبودهای الگوریتمی در هستهی استدلالش، بهتر میتواند از پس وظایف پیچیده و طولانی بربیاید. یکی از قابلیتهای مهم آن، امکان تنظیم میزان reasoning یا استدلال مدل است؛ یعنی کاربر میتواند بسته به نیازش بین سرعت پاسخ، کیفیت نتیجه و هزینه تعادل برقرار کند.
Flash دیگر صرفا مترادف «مدل سریع و ارزان برای کارهای ساده» نیست
جمنای ۳٫۷ فلش ورودی متن، تصویر، صدا و ویدئو را دریافت میکند و تا یکمیلیون توکن را در کانتکست خود نگه میدارد. این رقم در عمل یعنی مدل میتواند انبوهی از اسناد، فایلهای یک پروژه یا محتوای ویدئویی را در یک جلسه پردازش کند. خروجی مدل همچنان متنی است و سقف آن به ۶۴ هزار توکن میرسد.
چنین مشخصاتی بهتنهایی مدل را به یک برنامهنویس خودمختار تبدیل نمیکند؛ اما نشان میدهد گوگل دیگر مدلهای Flash را فقط برای درخواستهای کوتاه و کمهزینه نمیبیند. این مدل قرار است در نقش موتور اصلی اپلیکیشنهایی ظاهر شود که باید بار زیادی را با هزینهی کنترلشده پردازش کنند.
چه چیزهایی در جمنای ۳٫۷ فلش تغییر کرده است؟
یکی از مهمترین تغییرات جمنای ۳٫۷ فلش، تمرکز بیشتر آن بر کارهای چندمرحلهای و عاملمحور است. گوگل میگوید مدل هنگام روبهروشدن با بنبست، بهتر مسیرش را اصلاح میکند، دستورها را با وفاداری بیشتری دنبال میکند و در فراخوانی ابزارها و برنامهریزی چندمرحلهای، دقت بیشتری دارد.
در عمل، اگر این بهبودها در پروژههای واقعی هم تکرار شوند، میتوانند تعداد رفتوبرگشتها و اصلاحات دستی موردنیاز توسعهدهنده را کاهش دهند.
گوگل در نمونههای نمایشی خود، از ساخت بازی سهبعدی با یک پرامپت، تبدیل گزارش سالانه PDF به تجربهای تعاملی و هماهنگکردن زیربخشهای مختلف در یک پروژهی وب نام میبرد. این نمونهها جذاباند، اما بهتر است آنها را نمایش توانایی مدل بدانیم، نه تضمینی برای تکرار همان نتیجه در هر پروژه.
توسعهدهندگان میتوانند جمنای ۳٫۷ فلش را از طریق API جمنای، Google AI Studio، Google Antigravity و اندروید استودیو آزمایش و در محصولاتشان بهکار بگیرند. این مدل همچنین در Gemini Enterprise و Gemini Enterprise Agent Platform در دسترس مشتریان سازمانی قرار دارد.
برای کاربران عادی، جمنای ۳٫۷ فلش در Gemini Spark فعال شده است؛ ایجنتی شخصی که زیرنظر کاربر میتواند کارهایی مانند جمعآوری و سازماندهی فایلها، تهیه پیشنویس ایمیل و بهروزرسانی اسناد وضعیت را انجام دهد. جمنای اسپارک به اشتراک گوگل AI پرو یا اولترا نیاز دارد.
جمنای ۳٫۷ فلش ازطریق گوگل AI استودیو و API جمنای در پلن رایگان نیز قابل آزمایش است؛ اما این پلن محدودیت استفاده دارد و محتوای آن ممکن است برای بهبود محصولات گوگل استفاده شود. برای استفاده جدی و دسترسی به سقفهای بالاتر، باید از پلن پولی استفاده کرد.
عملکرد و بنچمارکهای جمنای ۳٫۷ فلش
به گفتهی گوگل، جمنای ۳٫۷ فلش بیشاز هر چیز برای مهندسی نرمافزار، تولید کد و اتوماسیون ساخته شده است؛ بههمین دلیل، برجستهترین نتایج رسمی نیز همین حوزهها را هدف میگیرند.
جمنای ۳٫۷ فلش در برابر جمنای ۳٫۶ فلش
یکی از مهمترین آزمونها DeepSWE v1.1 است که عملکرد مدلها را در وظایف مهندسی نرمافزار با افق بلندتر میسنجد. جمنای ۳٫۷ فلش در این آزمون به امتیاز ۶۵٫۳ درصد رسیده است؛ درحالیکه 3.6 Flash امتیاز ۴۸٫۶ درصد داشت. بهبیان دیگر، گوگل از جهشی نزدیک به ۱۷ واحد درصدی در کاری حرف میزند که صرفاً تولید چند خط کد نیست و حل مسئله در یک پروژه نرمافزاری را دربر میگیرد.
جمنای ۳٫۷ فلش بیشاز هر چیز برای مهندسی نرمافزار، تولید کد و اتوماسیون ساخته شده است
در FrontierCode 1.1، که کیفیت کد تولیدی را ارزیابی میکند، امتیاز مدل از ۳۴٫۴ درصد در نسل قبل به ۴۳٫۶ درصد رسیده است. امتیاز ۱۵۸۸ Elo در Code Arena نیز نشان میدهد مدل تازه برای ساخت رابطهای وب و اپلیکیشنهای کاملتر، عملکرد بهتری از 3.6 Flash دارد.
در بخش عاملهای هوش مصنوعی، فاصله دو نسل در AutomationBench چشمگیرتر بهنظر میرسد: 3.7 Flash امتیاز ۳۰٫۴ درصد گرفته، درحالیکه امتیاز نسخهی قبلی ۱۷ درصد بوده است. گوگل همچنین از بهبود مدل در درک اسناد PDF تخصصی و کار با محیطهای رایانهای خبر میدهد.
بنچمارک | جمنای ۳٫۷ فلش | جمنای ۳٫۶ فلش |
|---|---|---|
FrontierCode 1.1 (کیفیت کد تولیدی) | ۴۳٫۶٪ | ۳۴٫۴٪ |
DeepSWE v1.1 (مهندسی نرمافزار بلندمدت) | ۶۵٫۳٪ | ۴۸٫۶٪ |
Code Arena (توسعه وب) | ۱۵۸۸ Elo | ۱۵۳۸ Elo |
Terminal-Bench 2.1 (کدنویسی عاملمحور در ترمینال) | ۸۵٫۸٪ | ۷۸٪ |
AutomationBench (اتوماسیون گردشکار سازمانی) | ۳۰٫۴٪ | ۱۷٪ |
GDP.pdf (درک اسناد PDF تخصصی) | ۳۴٪ | ۲۲٪ |
OSWorld-2.0 (کار عامل با محیط رایانه) | ۴۷٫۹٪ | ۳۳٫۸٪ |
مقایسه جمنای ۳٫۷ فلش نسبت به نسخه قبل
جمنای ۳٫۷ فلش در شاخص هوش Artificial Analysis نیز امتیاز ۵۶ را ثبت کرده است؛ چهار امتیاز بالاتر از جمنای ۳٫۶ فلش. این شاخص چند ارزیابی مختلف را با هم ترکیب میکند و تصویری کلیتر از توانایی مدل ارائه میدهد؛ اما مانند هر بنچمارک و شاخص دیگری، جای آزمودن مدل در وظیفهی واقعی را نمیگیرد.
اگر Gemini 3.6 Flash قرار بود نشان دهد یک مدل Flash چقدر میتواند سریع و کارآمد باشد، Gemini 3.7 Flash میخواهد نشان دهد یک مدل سریع و نسبتاً ارزان تا چه حد میتواند واقعاً کار انجام دهد.
همهی این اعداد از ارزیابیهای منتشرشدهی خود گوگل آمدهاند. برخی از بنچمارکها عمومی و برخی دیگر، مانند AutomationBench در جدول گوگل، خصوصیاند. بنابراین نتایج برای نشاندادن جهت پیشرفت مدل مفید هستند؛ اما معادل آزمون مستقل و تکرارپذیر در تمام سناریوهای واقعی نیستند.
جمنای ۳٫۷ فلش در برابر رقبا
یکی از اشتباهات رایج هنگام بررسی مدلهای جدید، تبدیل برتری در یک بنچمارک به برتری کلی است. جمنای ۳٫۷ فلش نمونه خوبی از همین موضوع است.
برای مثال، جمنای ۳٫۷ فلش در آزمون Agent’s Last Exam به امتیاز ۲۶٫۳ درصد رسیده است؛ درحالیکه Claude Sonnet 5 با ۳۳٫۳ درصد عملکرد بهتری دارد. از سوی دیگر، جمنای در OSWorld-2.0 امتیاز ۴۷٫۹ درصدی ثبت کرده که از ۳۳٫۸ درصد جمنای ۳٫۶ فلش بالاتر است؛ اما همچنان به امتیاز ۵۰٫۲ درصدی GPT-5.6 Terra نمیرسد.
عملکرد ایجنت هوش مصنوعی یک معیار واحد نیست
این اختلافها نشان میدهند که «عملکرد ایجنت هوش مصنوعی» یک معیار واحد نیست. مدلی ممکن است در اجرای گردشکارهای مشخص، کدنویسی یا استفاده از ابزارها بسیار خوب عمل کند، اما در آزمونی دیگر که استدلال، کار با رایانه یا حل مسئله چندمرحلهای را میسنجد، نتیجه متفاوتی داشته باشد.
بههمین دلیل، بهتر است جمنای ۳٫۷ فلش را یک مدل قدرتمند برای کدنویسی و اتوماسیون بدانیم، نه مدلی که تمام رقبا را در هر سناریویی پشت سر میگذارد.
بنچمارک | چه چیزی را میسنجد؟ | جمنای ۳٫۷ فلش | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
FrontierCode 1.1 | کیفیت کد تولیدی برای استفاده واقعی | ۴۳٫۶٪ | ۴۲٫۷٪ | ۴۱٫۳٪ |
DeepSWE v1.1 | حل وظایف بلندمدت مهندسی نرمافزار | ۶۵٫۳٪ | ۵۳٫۸٪ | ۶۹٫۶٪ |
Code Arena | ساخت رابط کاربری و اپلیکیشن وب | ۱۵۸۸ Elo | ۱۵۴۱ Elo | ۱۵۲۳ Elo |
Terminal-Bench 2.1 | کدنویسی عاملمحور در محیط ترمینال | ۸۵٫۸٪ | ۸۰٫۴٪ | ۸۷٫۴٪ |
AutomationBench | اجرای گردشکارهای سازمانی چندمرحلهای | ۳۰٫۴٪ | ۱۰٫۷٪ | ۲۳٫۶٪ |
GDPVal-AA v2 | انجام کارهای دانشی و حرفهای | ۱۵۲۵ Elo | ۱۵۹۸ Elo | ۱۵۷۸ Elo |
GDP.pdf | درک و تحلیل اسناد PDF تخصصی | ۳۴٪ | ۲۸٪ | ۲۴٫۷٪ |
OSWorld-2.0 | کار عامل با محیطهای رایانهای و رابط گرافیکی | ۴۷٫۹٪ | — | ۵۰٫۲٪ |
Agent’s Last Exam | وظایف دشوار چندمرحلهای در دسکتاپ و سیستمعامل | ۲۶٫۳٪ | ۳۳٫۳٪ | ۲۸ |
مقایسه جمنای ۳٫۷ فلش با مهمترین رقبا (براساس ارزیابیهای منتشرشده از سوی گوگل)
البته جمنای ۳٫۷ فلش در چند آزمون هم دست بالا را دارد. برای مثال، در AutomationBench که اجرای گردشکارهای سازمانی چندمرحلهای را میسنجد، امتیاز ۳۰٫۴ درصدی جمنای از GPT-5.6 ترا با ۲۳٫۶ درصد و کلاد سونت ۵ با ۱۰٫۷ درصد بالاتر است. در FrontierCode 1.1 نیز جمنای با امتیاز ۴۳٫۶ درصد، اندکی از کلاد سونت ۵ با ۴۲٫۷ درصد و GPT-5.6 ترا با ۴۱٫۳ درصد پیشی میگیرد.
بااینحال، GPT-5.6 ترا در آزمونهای مرتبط با مهندسی نرمافزار بلندمدت همچنان رقیب قدرتمندتری است. این مدل در DeepSWE v1.1 امتیاز ۶۹٫۶ درصدی کسب کرده؛ درحالیکه امتیاز جمنای ۳٫۷ فلش ۶۵٫۳ درصد است. ترا در Terminal-Bench 2.1 نیز با امتیاز ۸۷٫۴ درصد، اندکی بالاتر از جمنای با ۸۵٫۸ درصد قرار میگیرد.
در کارهای دانشی نیز نتیجه یکطرفه نیست. کلاد سونت ۵ در GDPVal-AA v2 با امتیاز ۱۵۹۸ Elo و GPT-5.6 ترا با ۱۵۷۸ Elo، از امتیاز ۱۵۲۵ Elo جمنای بالاتر هستند. بااینحال، جمنای در درک PDF-های تخصصی عملکرد بهتری نشان داده و در GDP.pdf با امتیاز ۳۴ درصد، از کلاد با ۲۸ درصد و GPT با ۲۴٫۷ درصد جلو افتاده است.
نقطهی قوت اصلی جمنای ۳٫۷ فلش، ترکیب توانایی و هزینه است. مدلی در ردهی Flash که در برخی وظایف کدنویسی و اتوماسیون به مدلهای گرانتر نزدیک میشود.
نقطهی قوت اصلی جمنای ۳٫۷ فلش، ترکیب توانایی و هزینه است
برای تیمهایی که حجم بالایی از درخواستها را پردازش میکنند، نزدیکشدن کیفیت مدل به رقبای گرانتر میتواند هزینهی عملیاتی را بهطور محسوسی کاهش دهد؛ البته بهشرطی که عملکرد آن در وظایف واقعی، پایدار و قابلاعتماد باشد.
قیمت جمنای ۳٫۷ فلش
گوگل برای جمنای ۳٫۷ فلش تا پایان سال ۲۰۲۶، قیمت مقدماتی تعیین کرده است. هزینهی هر یکمیلیون توکن ورودی ۰٫۷۵ دلار و هر یکمیلیون توکن خروجی ۳٫۷۵ دلار است. این نرخ از اول ژانویهی ۲۰۲۷ بهترتیب به ۱٫۵ و ۷٫۵ دلار افزایش پیدا میکند.
نوع توکن | تا ۳۱ دسامبر ۲۰۲۶ | از اول ژانویه ۲۰۲۷ |
|---|---|---|
ورودی | ۰٫۷۵ دلار | ۱٫۵ دلار |
خروجی | ۳٫۷۵ دلار | ۷٫۵ دلار |
قیمت API در پلن پولی استاندارد
قیمت پایین فعلی یکی از مهمترین برگهای برندهی مدل است، اما نباید آن را هزینهی دائمی بهحساب آورد. اگر قصد دارید محصولی را برای ماهها یا سالهای بعد بسازید، بهتر است هزینه را با نرخ پس از پایان تخفیف محاسبه کنید.
قیمت اعلامشده برای Gemini 3.7 Flash قیمت دائمی مدل نیست
همچنین هزینهی واقعی یک عامل هوش مصنوعی فقط از ضرب تعداد توکن در قیمت API بهدست نمیآید. یک مدل ممکن است ارزانتر باشد، اما برای انجام همان کار به درخواستهای بیشتر، تلاش مجدد یا بازبینی انسانی بیشتری نیاز داشته باشد. در چنین شرایطی، معیار مهمتر هزینهی هر کار موفق است؛ نه صرفاً ارزانترین قیمت هر یکمیلیون توکن.
محدودیتهایی که باید در نظر بگیرید
جمنای ۳٫۷ فلش با وجود پیشرفتهایش، همچنان یک مدل زبانی است و امکان تولید اطلاعات نادرست یا توهم در آن وجود دارد. گوگل در مدلکارت خود به کندی مقطعی و پایان زمان اجرا نیز اشاره کرده است. گوگل میگوید گوگل تاریخ برش دانش (Knowledge Cutoff) جمنای ۳٫۷ فلش را مارس ۲۰۲۶ اعلام کرده است؛ بااینحال، در بعضی حوزهها اطلاعات مدل ممکن است به ژانویه ۲۰۲۵ محدود باشد.
همچنین نتایج بنچمارکها نشان میدهند عملکرد مدل بسته به نوع تسک تغییر میکند. بنابراین نمیتوان موفقیت آن در یک محیط مشخص را مستقیماً به تمام کاربردهای واقعی تعمیم داد. این مسئله برای ایجنتها اهمیت بیشتری دارد؛ زیرا یک ایجنت هوش مصنوعی ممکن است علاوه بر تولید پاسخ درست، مجبور باشد چندین مرحله را بدون خطا اجرا کند، ابزار مناسب را انتخاب کند، اشتباه خود را درست کند و در نهایت تسک را کامل تحویل دهد. در چنین سناریویی، یک بنچمارک بهتنهایی نمیتواند کیفیت واقعی سیستم را مشخص کند.
به گفته گوگل 3.7 Flash برای کسانی که میخواهند ایجنتهای کاملاً مستقل بسازند، میتواند وظایف منفرد کدنویسی را انجام دهد، اما هنوز استقلال لازم را برای زنجیرهکردن آنها در یک گردشکار پژوهشی سرتاسری و بدون دخالت انسان ندارد.
این نکته شاید در نگاه اول بدیهی باشد، اما تفاوت بزرگی میان ساختن یک دموی جذاب و سپردن تغییرات یک محصول واقعی به عامل وجود دارد. در کارهایی که با کدهای اصلی، دادههای حساس، تراکنشهای مالی یا تصمیمگیری برای کاربران سروکار دارند، نظارت انسانی و تعیین سطح دسترسی محدود برای ایجنت هوش مصنوعی همچنان ضروری است.
بازخوردهای ابتدایی کاربران از Gemini 3.7 Flash
از عرضه جمنای ۳٫۷ فلش تنها چند روز میگذرد؛ بنابراین بازخوردهای فعلی بیشتر تجربههای شخصی کاربران هستند تا نتیجه ارزیابیهای مستقل با روش یکسان. بااینحال، مرور بحثهای اولیه در ردیت، بهویژه در انجمن Google Antigravity، تصویری نسبتاً روشن از نقاط قوت و ضعف مدل ارائه میدهد.
کاربران: «جمنای ۳٫۷ فلش نسبت به نسلهای قبلی Flash در پروژهها عملکرد قابلاعتمادتری داشته.»
بیشترین بازخوردهای مثبت به کدنویسی، پیروی از دستورها و سرعت انجام وظایف مربوط میشود. برخی کاربران گفتهاند جمنای ۳٫۷ فلش نسبت به نسلهای قبلی Flash در پروژههایشان عملکرد قابلاعتمادتری داشته و نیازشان به جابهجایی میان مدلها را کمتر کرده است. شماری از توسعهدهندگان نیز از عملکرد بهتر مدل در وظایف چندمرحلهای و کار با کانتکستهای طولانی رضایت داشتهاند.
بااینحال، تجربه همه کاربران یکسان نیست. بعضی توسعهدهندگان میگویند خروجی نهایی، با وجود کیفیت مناسب، همچنان به نظارت و اصلاح مداوم نیاز دارد. در برخی گزارشها نیز به مصرف بالای توکن یا نیاز به تلاشهای مجدد، حتی در بعضی وظایف ساده، اشاره شده است.
کاربران: «خروجی نهایی، با وجود کیفیت مناسب، همچنان به نظارت و اصلاح مداوم نیاز دارد.»
کاربرانی که روی کدبیسهای بزرگ و پیچیده کار میکنند، محتاطتر به موضوع نگاه میکنند. از نظر آنها، نتایج امیدوارکننده بنچمارکها لزوماً به این معنا نیست که مدل در یک پروژه واقعی و طولانیمدت نیز همانقدر قابلاعتماد خواهد بود. در مقابل، برخی دیگر ترکیب جمنای ۳٫۷ فلش با مدلهای دیگر را راهی مناسب برای ساخت گردشکارهای سریعتر و کمهزینهتر میدانند.
در مجموع، برداشت اولیه از جمنای ۳٫۷ فلش مثبت است
در مجموع، برداشت اولیه از جمنای ۳٫۷ فلش مثبت است. این مدل در کدنویسی، سرعت و اجرای وظایف عملی توجه کاربران را جلب کرده، اما هنوز برای همه سناریوها و پروژههای جدی به یک انتخاب بیچونوچرا تبدیل نشده است.
جمنای ۳٫۷ فلش یک ارتقای معنادار برای مدلهای فلش گوگل محسوب میشود. بهبود آن در آزمونهای کدنویسی، مهندسی نرمافزار و اتوماسیون نشان میدهد گوگل میخواهد مدلهای سریع و کمهزینه را وارد کارهای جدیتری کند. اگر این نتایج در استفاده واقعی هم تکرار شوند، توسعهدهندگان میتوانند بخش بزرگی از کارهای تکراری برنامهنویسی، تحلیل اسناد و اتوماسیون را با مدلی ارزانتر انجام دهند و مدلهای پرچمدار را برای مرحلههای دشوارتر نگه دارند.
این تغییر شاید برای کاربر عادی چندان ملموس نباشد، اما برای کسبوکارهایی که هر روز هزاران درخواست پردازش میکنند، اهمیت زیادی دارد. بااینحال، جمنای ۳٫۷ فلش هنوز به معنای رسیدن به عامل خودمختار نیست. این مدل میتواند دستیار فنی قدرتمندی باشد، نه جایگزینی بدون نظارت برای توسعهدهنده، تحلیلگر یا مدیر پروژه.
نظر شما در مورد مدل جدید گوگل چیست؟ آیا شما جمنای ۳٫۷ فلش را امتحان کردهاید؟ تجربهتان از عملکرد این مدل را در بخش دیدگاهها با زومیت و دیگر کاربران بهاشتراک بگذارید.