توسعه و به‌کارگیری مدل‌های زبانی بزرگ، همواره با چالش موازنه‌ی قدرت پردازش و هزینه‌های عملیاتی روبه‌رو بوده است. معرفی نسل‌های جدید معمولا جهش عملکردی چشمگیری به‌همراه دارد، اما هزینه‌های بالای توکن‌ها مانعی جدی برای پیاده‌سازی گسترده‌ی عامل‌های هوشمند به شمار می‌رود. مدل تازه‌ی GPT-6.1 Sol با هدف درهم‌شکستن این سد محاسباتی، تعادل تازه‌ای میان توانمندی بالا و بهره‌وری اقتصادی ارائه می‌دهد.

هوش مصنوعی GPT-6.1 Sol ارتقایی بر GPT-6 Sol محسوب می‌شود که در زمینه‌های کدنویسی عامل‌محور، کار با برنامه‌های کامپیوتر و وظایف حرفه‌ای، عملکردی بسیار نزدیک به مدل پیشرفته‌ی GPT-6 Astra ارائه می‌دهد؛ درحالی‌که قیمت توکن‌های ورودی و خروجی استاندارد آن تنها یک‌پنجم نسخه‌ی آسترا است.

OpenAI

هزینه‌ی توکن ورودی کَش‌شده (Cached input) در مدل جدید به ۰٫۱۰ دلار به‌ازای هر یک میلیون توکن کاهش یافته که ۹۵ درصد ارزان‌تر از نرخ ورودی استاندارد و ۵۰ درصد کمتر از ورودی کَش‌شده در نسل پیشین است. چنین بهینه‌سازی قیمتی، دست توسعه‌دهندگان را برای بازخوانی مداوم پنجره‌ی متنی و ساخت عامل‌های کارآمدتر کاملا باز می‌گذارد.

درخشش در بنچمارک‌های مهندسی

ارزیابی‌های تخصصی نشان می‌دهند که پیشرفت‌های حاصل در حوزه‌های متنوع کاری ملموس هستند. در بنچمارک مهندسی نرم‌افزار DeepSWE v1.1 که پروژه‌های واقعی پایگاه کد را می‌سنجد، عملکرد GPT-6.1 Sol تقریبا هم‌پای GPT-6 Astra ثبت شد، در شرایطی که هزینه‌ی آن حدود یک‌پنجم است و نسبت به بهترین رکورد GPT-6 Sol با میزان تفکر کمتر، ارتقای ۶٫۴ درصدی را نشان می‌دهد.

نمودار مقایسه امتیاز عملکرد و هزینه هر تسک برای مدل‌های GPT-6.1 Sol و GPT-6 Astra
نمودار مقایسه امتیاز عملکرد و هزینه هر تسک برای مدل‌های GPT-6.1 Sol و GPT-6 Astra و Opus 5.5
نمودار مقایسه امتیاز و هزینه هر تسک برای مدل‌های GPT-6.1 Sol، GPT-6 Sol و GPT-6 Astra

آزمون‌های مربوط به تحلیل اسناد پیچیده و فرایندهای اداری نیز گویای برتری فنی هستند:

  • در بنچمارک GDP.pdf برای درک اسناد پی‌دی‌اف حاوی نمودارها، جداول و جزئیات ریز، امتیازی بالاتر از Opus 5.5 با کمتر از نصف هزینه‌ی هر وظیفه ثبت شده و هم‌زمان فاصله‌ی ناچیزی با مدل پرچم‌دار آسترا حفظ شده است.
  • در آزمون AutomationBench با تمرکز بر تکمیل جریان‌های کاری چندمرحله‌ای کسب‌وکار، این مدل با تفکر متوسط ۲٫۲ درصد فراتر از Opus 5.5 و ۴٫۸ درصد بالاتر از نسل پیشین خود قرار گرفت.
  • در ارزیابی OSWorld 2.0 که توانایی تعامل با رابط‌های نرم‌افزاری کامپیوتر را بررسی می‌کند، مدل جدید در حالت حداکثر تلاش محاسباتی، هفت درصد از نسخه‌ی پیشین بهتر عمل کرده و فاصله‌ی خود را با پرچم‌دار آسترا به ۲٫۱ درصد رسانده است.

تحلیل‌های علمی و بهبود دقت واقع‌گرایانه

توانایی‌های پژوهشی این ابزار در بستر ارزیابی Terminal-Bench Science 0.1 جهش چشمگیری پیدا کرده است. امتیاز مدل در اجرای وظایف تحلیل داده، شبیه‌سازی و اثبات قضایای علمی نسبت به نسخه‌ی پیشین بیش از دو برابر شده، درحالی‌که هزینه‌ی انجام هر وظیفه به ۵٫۴۷ دلار رسیده است؛ عددی که در مقایسه با ۲۳٫۲۱ دلار در مدل Opus 5.5 و ۲۳٫۸۰ دلار در مدل Astra، بیش از ۷۵ درصد صرفه‌جویی اقتصادی رقم می‌زند. مدل آسترا کماکان با کسب امتیاز ۶۸٫۱ درصد، رتبه‌ی نخست را برای پیچیده‌ترین تحقیقات بنیادین حفظ می‌کند.

OpenAI

دقت ارائه‌ی فکت‌ها در پرامپت‌های دشوار نیز ارتقا یافته است. در شرایط تفکر حداقلی، نرخ خطاهای حاوی پاسخ‌های نادرست از ۱۱٫۴ درصد به ۷٫۷ درصد کاهش پیدا کرده که کاهشی نزدیک به ۳۲ درصد در خطاها محسوب می‌شود. بررسی‌های امنیتی و انطباق رفتاری حاکی است که سیستم شفافیت بیشتری در مواجهه با ابزارهای جستجوی ناموفق نشان می‌دهد و هیچ‌گونه تلاشی برای دور زدن ناظران امنیتی خودکار مشاهده نشده است.

دسترسی به GPT-6.1 Sol از امروز برای مشترکان حساب‌های پلاس، پرو، تجاری، سازمانی و آموزشی در بخش‌های ChatGPT Work و Codex فراهم شده است، هرچند سرویس چت عمومی فعلا این نسخه را دریافت نمی‌کند.

توسعه‌دهندگان می‌توانند از طریق رابط برنامه‌نویسی نرم‌افزار به این هوش با شناسه‌ی gpt-6.1-sol دست پیدا کنند. نرخ رسمی ای‌پی‌آی شامل ۲ دلار به‌ازای هر میلیون توکن ورودی، ۰٫۱۰ دلار برای توکن‌های کش‌شده و ۱۰ دلار برای هر میلیون توکن خروجی تعیین شده است. در روزهای آینده، نسخه‌ی شتاب‌یافته‌ی GPT-6.1 Sol Ultrafast با سرعت تولید تا هشت برابر بیشتر در محیط کدکس در دسترس متقاضیان قرار خواهد گرفت.