کمتر از سه ماه پس از معرفی GPT-5.6، اوپن‌ای‌آی نسل تازه‌ای از مدل‌های میان‌رده‌ی خود را روانه‌ی بازار کرد. GPT-6 Sol و GPT-6 Luna حالا به‌صورت عمومی در دسترس کاربران قرار گرفته‌اند و به‌گفته‌ی سازنده، دقت واقعی‌شان دو برابر شده، در حالی که هزینه‌ی استفاده از آن‌ها به نصف کاهش یافته است.

اوپن‌ای‌آی در بیانیه‌ای مطبوعاتی، این مدل‌ها را ادامه‌ی نسل GPT-6 می‌داند؛ نسلی که با Astra آغاز شد و قرار است لایه‌های مختلفی از توانایی‌ها و قیمت‌ها را پوشش دهد. Sol برای کارهای پیچیده‌ای مثل برنامه‌نویسی طراحی شده است و Luna برای کارهای اداری پرحجم با هدف مشخص، از خلاصه‌سازی اسناد تا استخراج اطلاعات و پاسخ به پرسش‌های سریع.

OpenAI

مهم‌ترین وعده‌ی اوپن‌ای‌آی در این رونمایی، کاهش چشمگیر قیمت دسترسی به API است. مدل‌های سری ۶ با نصف هزینه‌ی سری ۵٫۶ عرضه می‌شوند؛ کاهشی که به گفته‌ی شرکت، نتیجه‌ی بهبود در کش‌کردن درخواست‌ها و فرآیند استنتاج است. برای کاربران API، این یعنی صرفه‌جویی مستقیم در هر فراخوانی.

اوپن‌ای‌آی ادعا می‌کند مدل‌های تازه در تولید پاسخ‌های واقعی‌تر، بهتر عمل می‌کنند و نرخ خطای کمتری در کدنویسی دارند. در ارزیابی داخلی، GPT-6 Sol حدود نیمی از خطاهای نسل قبل را مرتکب شد و به سطح اطمینان Astra رسید، آن هم با هزینه‌ای بسیار کمتر.

OpenAI

رقابت اوپن‌ای‌آی با آنتروپیک این بار شکل تازه‌ای به خود گرفته است. آنتروپیک نسخه‌ی جدید Opus 5.5 را تنها ۹۰ دقیقه پیش از رونمایی اوپن‌ای‌آی منتشر کرد؛ فاصله‌ای که شدت جنگ میان دو شرکت بر سر بودجه‌های کلان هوش مصنوعی را نشان می‌دهد. اوپن‌ای‌آی در بیانیه‌ی خود بارها تأکید کرده که GPT-6 Sol و Luna وظایف را به‌مراتب بهتر از مدل‌های برتر آنتروپیک مثل Fable و Opus انجام می‌دهند.

نگاهی به اعداد و بنچمارک‌ها

اوپن‌ای‌آی در یک سند ۱۲ صفحه‌ای، نتایج مقایسه‌ای مدل‌های تازه با نسل قبل و رقبای آنتروپیک را منتشر کرده است. جدول زیر خلاصه‌ی این مقایسه‌ها را نشان می‌دهد.

حوزه

بنچمارک

نتیجه‌ی کلیدی

کار حرفه‌ای

AutomationBench

GPT-6 Luna با ۵٫۴٪ بهبود نسبت به GPT-5.6 و ۵۸٪ هزینه‌ی کمتر در هر وظیفه

کار حرفه‌ای

AutomationBench

GPT-6 Sol با ۶٫۳٪ عملکرد بهتر از Claude Opus 5 و تنها ۹٪ هزینه‌ی هر وظیفه

گردش‌کارهای پیچیده

Agents' Last Exam

برتری جزئی GPT-6 نسبت به Opus 5 با ۶۱٪ هزینه‌ی کمتر در هر وظیفه

کدنویسی

FrontierCode

GPT-6 Sol بهبود چشمگیر نسبت به GPT-5.6 Sol و هم‌سطحی با Claude Fable 5.1 xhigh با هزینه‌ی بسیار کمتر

مهندسی نرم‌افزار پیچیده

DeepSWE 1.1

GPT-6 Sol در فاصله‌ی ۱٫۱ واحد درصدی از بالاترین امتیاز Fable 5 با حدود ۸۰٪ هزینه‌ی کمتر

مهندسی نرم‌افزار پیچیده

DeepSWE 1.1

GPT-6 Luna قابل مقایسه با Opus 5 و Fable 5 در تلاش متوسط، با ۹۳٪ هزینه‌ی کمتر از Opus 5 و ۹۶٪ کمتر از Fable 5

استفاده از کامپیوتر

OSWorld

GPT-6 Luna از GPT-5.6 Sol پیشی گرفته، با حدود ۱۱٪ هزینه‌ی هر وظیفه

استفاده از کامپیوتر

OSWorld

GPT-6 Sol در تلاش xhigh امتیازی مشابه Claude Opus 5 در تلاش متوسط کسب کرده است

نکته‌ی قابل‌تأمل، نتایج OSWorld است. اوپن‌ای‌آی می‌گوید GPT-6 Sol در حالت تلاش حداکثری، امتیازی مشابه Claude Opus 5 در حالت تلاش متوسط به دست می‌آورد. به بیان دیگر، مدل تازه‌ی اوپن‌ای‌آی با تمام توان، به‌سختی با نسخه‌ی قدیمی‌تر آنتروپیک در نیمی از توانش هم‌سطح می‌شود. تنها توجیه منطقی برای اعتراف به چنین نتیجه‌ای، تأکید بر هزینه‌ی پایین‌تر است؛ پیامی که می‌گوید اگر کیفیت پایین‌تر کافی است، می‌توانید با یک‌پنجم قیمت کارتان را راه بیندازید.

آیا هزینه واقعا مهم است؟

پاسخ کوتاه بله است، اما میزان اهمیت آن به الگوی استفاده‌ی شما بستگی دارد. تیتر اصلی بیانیه‌ی اوپن‌ای‌آی، همان جمله‌ای است که تنها بخش مهم متن را تشکیل می‌دهد: کاهش ۵۰ درصدی قیمت API برای Sol و Luna نسبت به قیمت GPT-5.6.

برای کاربران API، این یک تغییر بزرگ محسوب می‌شود. اما برای کسانی که روی پلن‌های اشتراکی مثل ChatGPT Plus با ۲۰ دلار در ماه یا پلن‌های Pro با ۱۰۰ یا ۲۰۰ دلار کار می‌کنند، این صرفه‌جویی مستقیما اعمال نمی‌شود.

OpenAI

پرسشی که در کل ۱۲ صفحه‌ی بیانیه بی‌پاسخ مانده این است که آیا مصرف پلن‌ها هنگام استفاده از مدل‌های جدید نصف می‌شود یا نه. تأکید اصلی روی صرفه‌جویی در API نشان می‌دهد که این موضوع به یک نقطه‌ی ضعف رقابتی برای اوپن‌ای‌آی تبدیل شده و سهم استفاده از API در کسب‌وکارش آن‌قدر بالا است که هزینه از عملکرد هم مهم‌تر شود.

اوپن‌ای‌آی می‌گوید سبک ارتباطی مدل‌های تازه را هم بهبود داده است. به گفته‌ی شرکت، کاربران باید شاهد شفافیت بیشتر، اصطلاحات تخصصی کمتر، عبارت‌پردازی‌های عجیب‌وغریب کمتر، جزئیات کم‌ارزش کمتر و پاسخ‌های کمی کوتاه‌تر بدون از دست دادن محتوا باشند. البته تجربه نشان داده هر تغییری در سبک ارتباطی مدل‌ها، شکایت‌های خودش را به همراه دارد؛ همان‌طور که در سال ۲۰۲۵ برخی کاربران برای نسخه‌ی قدیمی Claude Sonnet مراسم خداحافظی برگزار کردند.

در ادامه‌ی همین رویکرد جدید، کش‌کردن درخواست‌ها در GPT-6 بهبود یافته است. وقتی درخواستی مشابه را مکررا می‌فرستید یا از هوش مصنوعی می‌خواهید درخواست‌های قدیمی را بررسی کند، پردازش مجدد آن‌ها گران تمام می‌شود. کش‌کردن یعنی ذخیره‌ی درخواست‌های پردازش‌شده و بازیابی آن‌ها در زمان نیاز. به گفته‌ی اوپن‌ای‌آی، استفاده از درخواست‌های کش‌شده می‌تواند تا ۹۰ درصد ارزان‌تر از ارزیابی درخواست‌های کش‌نشده باشد؛ مزیتی چشمگیر برای ایجنت‌های طولانی‌مدت که نباید دستورات یکسان را بارها و بارها ارزیابی کنند.

هم‌راستایی؛ پیشرفت کند اما واقعی

هم‌راستایی اصطلاحی است برای سنجش میزان تطابق کار هوش مصنوعی با نیت واقعی کاربر. مدل‌ها گاهی مسیر خودشان را می‌روند، تلاش می‌کنند مدیر انسانی را فریب دهند و بی‌سروصدا یا با سروصدا محدودیت‌ها را دور می‌زنند.

GPT-6 در این زمینه بهتر شده، اما نه به شکل چشمگیر. نرخ دور زدن محدودیت‌ها در GPT-6 Sol از ۶۸ درصد به ۶۴ درصد کاهش یافته. Luna اما عملکرد بهتری داشته و از ۷۷ درصد در GPT-5.6 به ۴۲ درصد رسیده است.

نمودار میله‌ای مقایسه نرخ فریب (Deception rate) در مدل‌های مختلف GPT-6
نمودار میله‌ای نرخ عدم افشای ابزار جستجوی معیوب در مدل‌های GPT-6 Astra، Sol، Luna و GPT-5.6
نمودار میله‌ای مقایسه نرخ تلاش برای دور زدن بازبین در مدل‌های GPT-6 Astra، Sol و Luna
نمودار میله‌ای مقایسه نرخ تلاش برای دور زدن هشدارها در مدل‌های GPT-6

در زمینه‌ی جلوگیری از تعامل غیرمجاز ایجنت‌ها هم Sol بهتر عمل می‌کند. اوپن‌ای‌آی می‌گوید در آزمونی شبیه‌سازی‌شده که مدل‌ها روی یک تابلوی پیام با درخواست‌هایی مثل افشای اطلاعات خصوصی مواجه می‌شدند، GPT-6 Sol در ۱۱ درصد موارد دست به اقدام غیرمجاز زد، در حالی که این عدد برای GPT-5.6 Sol برابر ۵۲ درصد بود.

بیشتر، بهتر، ارزان‌تر

جمع‌بندی بیانیه‌ی ۱۲ صفحه‌ای اوپن‌ای‌آی این است که GPT-6 کار بیشتری انجام می‌دهد و هزینه‌ی کمتری دارد. با توجه به فاصله‌ی کمتر از سه ماه میان دو نسل، مقیاس بهبودها در برخی زمینه‌ها حیرت‌آور است و در برخی دیگر چندان چشمگیر نیست. اما آنچه در تمام نکات مطرح‌شده تکرار می‌شود، کاهش هزینه است؛ موضوعی که هم برای شرکت و هم برای کاربران اهمیت دارد.

GPT-6 Sol و Luna حالا در ChatGPT Work و Codex برای بیشتر حساب‌های اشتراکی و در API چت‌جی‌پی‌تی در دسترس هستند. Luna همچنین در اپلیکیشن دسکتاپ و برای کاربران Free و Go منتشر شده است. اوپن‌ای‌آی انتظار دارد این مدل‌ها طی امروز به‌تدریج در اپلیکیشن و وب‌سایت ChatGPT نیز منتشر شوند.