توسعه و بهکارگیری مدلهای زبانی بزرگ، همواره با چالش موازنهی قدرت پردازش و هزینههای عملیاتی روبهرو بوده است. معرفی نسلهای جدید معمولا جهش عملکردی چشمگیری بههمراه دارد، اما هزینههای بالای توکنها مانعی جدی برای پیادهسازی گستردهی عاملهای هوشمند به شمار میرود. مدل تازهی GPT-6.1 Sol با هدف درهمشکستن این سد محاسباتی، تعادل تازهای میان توانمندی بالا و بهرهوری اقتصادی ارائه میدهد.
هوش مصنوعی GPT-6.1 Sol ارتقایی بر GPT-6 Sol محسوب میشود که در زمینههای کدنویسی عاملمحور، کار با برنامههای کامپیوتر و وظایف حرفهای، عملکردی بسیار نزدیک به مدل پیشرفتهی GPT-6 Astra ارائه میدهد؛ درحالیکه قیمت توکنهای ورودی و خروجی استاندارد آن تنها یکپنجم نسخهی آسترا است.
هزینهی توکن ورودی کَششده (Cached input) در مدل جدید به ۰٫۱۰ دلار بهازای هر یک میلیون توکن کاهش یافته که ۹۵ درصد ارزانتر از نرخ ورودی استاندارد و ۵۰ درصد کمتر از ورودی کَششده در نسل پیشین است. چنین بهینهسازی قیمتی، دست توسعهدهندگان را برای بازخوانی مداوم پنجرهی متنی و ساخت عاملهای کارآمدتر کاملا باز میگذارد.
درخشش در بنچمارکهای مهندسی
ارزیابیهای تخصصی نشان میدهند که پیشرفتهای حاصل در حوزههای متنوع کاری ملموس هستند. در بنچمارک مهندسی نرمافزار DeepSWE v1.1 که پروژههای واقعی پایگاه کد را میسنجد، عملکرد GPT-6.1 Sol تقریبا همپای GPT-6 Astra ثبت شد، در شرایطی که هزینهی آن حدود یکپنجم است و نسبت به بهترین رکورد GPT-6 Sol با میزان تفکر کمتر، ارتقای ۶٫۴ درصدی را نشان میدهد.



آزمونهای مربوط به تحلیل اسناد پیچیده و فرایندهای اداری نیز گویای برتری فنی هستند:
- در بنچمارک GDP.pdf برای درک اسناد پیدیاف حاوی نمودارها، جداول و جزئیات ریز، امتیازی بالاتر از Opus 5.5 با کمتر از نصف هزینهی هر وظیفه ثبت شده و همزمان فاصلهی ناچیزی با مدل پرچمدار آسترا حفظ شده است.
- در آزمون AutomationBench با تمرکز بر تکمیل جریانهای کاری چندمرحلهای کسبوکار، این مدل با تفکر متوسط ۲٫۲ درصد فراتر از Opus 5.5 و ۴٫۸ درصد بالاتر از نسل پیشین خود قرار گرفت.
- در ارزیابی OSWorld 2.0 که توانایی تعامل با رابطهای نرمافزاری کامپیوتر را بررسی میکند، مدل جدید در حالت حداکثر تلاش محاسباتی، هفت درصد از نسخهی پیشین بهتر عمل کرده و فاصلهی خود را با پرچمدار آسترا به ۲٫۱ درصد رسانده است.
تحلیلهای علمی و بهبود دقت واقعگرایانه
تواناییهای پژوهشی این ابزار در بستر ارزیابی Terminal-Bench Science 0.1 جهش چشمگیری پیدا کرده است. امتیاز مدل در اجرای وظایف تحلیل داده، شبیهسازی و اثبات قضایای علمی نسبت به نسخهی پیشین بیش از دو برابر شده، درحالیکه هزینهی انجام هر وظیفه به ۵٫۴۷ دلار رسیده است؛ عددی که در مقایسه با ۲۳٫۲۱ دلار در مدل Opus 5.5 و ۲۳٫۸۰ دلار در مدل Astra، بیش از ۷۵ درصد صرفهجویی اقتصادی رقم میزند. مدل آسترا کماکان با کسب امتیاز ۶۸٫۱ درصد، رتبهی نخست را برای پیچیدهترین تحقیقات بنیادین حفظ میکند.
دقت ارائهی فکتها در پرامپتهای دشوار نیز ارتقا یافته است. در شرایط تفکر حداقلی، نرخ خطاهای حاوی پاسخهای نادرست از ۱۱٫۴ درصد به ۷٫۷ درصد کاهش پیدا کرده که کاهشی نزدیک به ۳۲ درصد در خطاها محسوب میشود. بررسیهای امنیتی و انطباق رفتاری حاکی است که سیستم شفافیت بیشتری در مواجهه با ابزارهای جستجوی ناموفق نشان میدهد و هیچگونه تلاشی برای دور زدن ناظران امنیتی خودکار مشاهده نشده است.
دسترسی به GPT-6.1 Sol از امروز برای مشترکان حسابهای پلاس، پرو، تجاری، سازمانی و آموزشی در بخشهای ChatGPT Work و Codex فراهم شده است، هرچند سرویس چت عمومی فعلا این نسخه را دریافت نمیکند.
توسعهدهندگان میتوانند از طریق رابط برنامهنویسی نرمافزار به این هوش با شناسهی gpt-6.1-sol دست پیدا کنند. نرخ رسمی ایپیآی شامل ۲ دلار بهازای هر میلیون توکن ورودی، ۰٫۱۰ دلار برای توکنهای کششده و ۱۰ دلار برای هر میلیون توکن خروجی تعیین شده است. در روزهای آینده، نسخهی شتابیافتهی GPT-6.1 Sol Ultrafast با سرعت تولید تا هشت برابر بیشتر در محیط کدکس در دسترس متقاضیان قرار خواهد گرفت.