وقتی OpenAI از GPT-6 Astra رونمایی کرد، فقط از یک مدل زبانی جدید حرف نزد؛ این شرکت مدعی شد هوش مصنوعی وارد مرحلهای تازه شده است. گرگ براکمن، رئیس اوپنایآی، گفت شاید سالها بعد همین دوره زمانی بهعنوان یکی از نقاط آغاز عصر AGI شناخته شود؛ ادعایی که GPT-6 Astra را از یک ارتقای معمولی در دنیای مدلهای زبانی جدا میکند.
اما دلیل اهمیت استرا فقط این ادعای بزرگ نیست. این مدل قرار است مرز میان «پرسیدن از هوش مصنوعی» و «سپردن کار به هوش مصنوعی» را جابهجا کند. اوپنایآی میگوید استرا میتواند با کامپیوتر کار کند، بین نرمافزارها حرکت کند، ابزارها را به کار بگیرد، کد بنویسد، وب را جستوجو کند و وظایف چندمرحلهای را تا رسیدن به نتیجه دنبال کند.
دموهای اولیه اوپنایآی هم دقیقاً روی همین ایده تمرکز داشتند؛ جایی که استرا با فرمان صوتی میتواند از یک ایده ساده، خروجیهای پیچیدهتری مثل طراحی، ساخت نمونه نرمافزاری یا انجام کارهای واقعی در سرویسهای مختلف ایجاد کند. همین قابلیتها باعث شده برخی آن را نزدیکترین قدم اوپنایآی به ایده یک عامل هوشمند عمومی بدانند.
اما بین یک نمایش خیرهکننده و یک تغییر واقعی در دنیای فناوری فاصله وجود دارد. امتیازهای بالای بنچمارکها همیشه به معنی عملکرد بهتر در دنیای واقعی نیستند؛ همانطور که هزینه، سرعت، محدودیتهای ایمنی و تجربه کاربران هم بخشی از تصویر هستند.
GPT-6 Astra چیست و چرا مهم است؟
GPT-6 Astra (استرا) مدل پرچمدار جدید OpenAI است که در ۳ سپتامبر ۲۰۲۶ معرفی شد. این مدل در API با شناسه gpt-6-astra عرضه شده و برای کارهایی مانند استفاده از کامپیوتر، مرور وب، مهندسی نرمافزار، امنیت سایبری، علوم و فعالیتهای حرفهای طراحی شده است.
تفاوت اصلی استرا با بسیاری از نسلهای قبلی مدلهای زبانی، رویکرد عاملمحور آن است. این مدل فقط برای تولید پاسخ بهتر ساخته نشده؛ بلکه میتواند یک هدف را دریافت کند، مراحل لازم را برنامهریزی کند، از ابزارها استفاده کند و در طول مسیر تصمیمهای جدید بگیرد.
یکی از مهمترین ویژگیهای فنی استرا، پنجره کانتکست ۱٫۰۵ میلیونتوکنی آن است؛ ظرفیتی که به توسعهدهندگان اجازه میدهد حجم بزرگی از متن، فایل یا اطلاعات یک پروژه را در اختیار مدل قرار دهند. البته ظرفیت بیشتر بهتنهایی تضمین نمیکند مدل همیشه در پروژههای بسیار طولانی دقت و انسجام کامل داشته باشد.
استرا همچنین مجموعه گستردهای از قابلیتهای ابزاری را در اختیار توسعهدهندگان قرار میدهد. این مدل از فراخوانی تابع (Function Calling)، خروجیهای ساختاریافته (Structured Outputs) و ابزارهای مختلف Responses API پشتیبانی میکند؛ ابزارهایی مانند جستوجوی وب و فایل، اجرای کد، شل میزبانیشده، اعمال تغییرات کد، استفاده از کامپیوتر، MCP و جستوجوی ابزارها.
استرا با قابلیتهای ابزارمحور گسترده، برای انجام وظایف پیچیده و چندمرحلهای طراحی شده است.
دو قابلیت جدید نیز نقش مهمی در طراحی عاملمحور استرا دارند. Async Tool Calling اجازه میدهد مدل هنگام اجرای یک ابزار زمانبر، کاملاً متوقف نشود و بخشهای دیگری از کار را ادامه دهد.
Mid-turn Steering نیز امکان تغییر مسیر اجرای وظیفه را در میانه کار فراهم میکند؛ قابلیتی که برای گردشکارهای طولانی و پیچیده اهمیت زیادی دارد.
در کنار این قابلیتها، استرا چند سطح مختلف برای میزان تلاش استدلالی ارائه میدهد؛ از Low تا Max. توسعهدهندگان میتوانند بر اساس نوع وظیفه، بین کیفیت، سرعت و هزینه تعادل ایجاد کنند. البته اوپنایآی جزئیات دقیقی درباره اینکه هر سطح استدلال در شرایط مختلف چه تأثیری روی عملکرد نهایی دارد منتشر نکرده است.
مشخصات فنی استرا
ویژگی | مشخصات |
|---|---|
سازنده | OpenAI |
تاریخ معرفی | ۳ سپتامبر ۲۰۲۶ |
شناسه API | gpt-6-astra |
پنجره کانتکست | ۱٬۰۵۰٬۰۰۰ توکن |
حداکثر خروجی | ۱۲۸٬۰۰۰ توکن |
ورودی | متن و تصویر |
خروجی | متن |
تاریخ آخرین بهروزرسانی دانش (Knowledge cutoff) | ۳۰ آوریل ۲۰۲۶ |
سطح تلاش استدلالی (Reasoning effort) | low، medium، high، xhigh و max |
فراخوانی تابع (Function calling) | پشتیبانی میشود |
خروجیهای ساختاریافته (Structured Outputs) | پشتیبانی میشود |
تنظیم دقیق مدل (Fine-tuning) | پشتیبانی نمیشود |
قیمت ورودی در Standard API | ۱۰ دلار / یک میلیون توکن |
قیمت خروجی در Standard API | ۵۰ دلار / یک میلیون توکن |
وضعیت در ChatGPT | عرضه تدریجی برای حسابها و پلنهای واجدشرایط پولی |
مهمترین تغییر Astra را باید در قابلیتهای عاملمحور آن جستوجو کرد؛ مدلی که بهجای صرفاً توضیح دادن مراحل انجام یک کار، میتواند بخشی از آن را خودش اجرا کند.
یکی از شاخصترین قابلیتهای استرا، استفاده از کامپیوتر (Computer Use) است. مدل میتواند با صفحهنمایش، ماوس و کیبورد تعامل کند و کارهایی مانند پر کردن فرمها، بهروزرسانی CRM، مدیریت تقویم، جستوجوی وب، کار با فایلها و حتی ساخت و آزمایش وبسایتها را انجام دهد. این رویکرد میتواند نیاز به API، افزونه و اتصالهای اختصاصی برای هر سرویس را کاهش دهد.
پخش از رسانه
این رویکرد میتواند شیوه تعامل کسبوکارها با هوش مصنوعی را تغییر دهد. در سالهای اخیر، شرکتها برای وصل کردن مدلهای هوش مصنوعی به سیستمهای داخلی خود مجبور بودند API، افزونه، کانکتور و لایههای نرمافزاری مختلف بسازند. استرا تلاش میکند بخشی از این پیچیدگی را با تعامل مستقیم با محیط کاربر کاهش دهد.
رویکرد آسترا میتواند شیوه تعامل کسبوکارها با هوش مصنوعی را تغییر دهد
در نتیجه، خروجی استرا دیگر لزوماً فقط یک متن نیست؛ کاربر میتواند هدفی را مشخص کند و مدل مجموعهای از اقدامات را برای رسیدن به آن انجام دهد.
بااینحال، این قابلیت به معنی حذف کامل انسان از فرایند نیست و در کارهای حساس همچنان نظارت انسانی اهمیت دارد. ارزش اصلی استرا فعلاً در کاهش کارهای تکراری و چندمرحلهای و سپردن بخشی از اجرای آنها به هوش مصنوعی است.
GPT-6 Astra در مقایسه با GPT-5.6 Sol چقدر بهتر شده است؟
مقایسه آسترا با GPT-5.6 Sol شاید منطقیترین نقطه شروع برای سنجش پیشرفت این مدل باشد؛ چون نشان میدهد اوپنایآی در یک نسل جدید چه مسیری را طی کرده است.
دادههای موجود تصویر نسبتاً مشخصی ارائه میکنند؛ آسترا در بسیاری از وظایف پیچیده، بهخصوص کارهایی که به استفاده از ابزار، اجرای چند مرحله و استدلال طولانی نیاز دارند، نسبت به Sol پیشرفت کرده است. اما این پیشرفت بدون هزینه نیست؛ در برخی ارزیابیهای مستقل، آسترا سرعت پایینتر و هزینه بیشتری نسبت به نسل قبل داشته است.
آسترا در بسیاری از وظایف پیچیده نسبت به Sol پیشرفت کرده است
به بیان ساده، استرا بیشتر شبیه یک ارتقای هدفمند برای کارهای پیچیده است، نه یک جایگزین سریعتر و ارزانتر برای همه کاربران. اگر استفاده اصلی شما از هوش مصنوعی نوشتن متن، خلاصهسازی یا پرسشهای روزمره باشد، اختلاف میان استرا و Sol احتمالاً به اندازه نتایج آزمایشگاهی محسوس نیست.
اما اگر مدل قرار است کد بنویسد، ابزار اجرا کند، فایل تحلیل کند یا یک گردشکار چندمرحلهای را مدیریت کند، تفاوت آن بیشتر دیده میشود.
قابلیتهای ذکرشده استرا را بیشتر به معماری یک دستیار اجرایی نزدیک میکنند تا یک مدل پرسشوپاسخ ساده. اما آیا این تواناییها در عمل به همان اندازهای که در معرفیها جذاب به نظر میرسند، قابل اعتماد هستند؟ پاسخ این سؤال را باید در ترکیب سه چیز پیدا کرد: نتایج آزمایشها، تجربه کاربران و محدودیتهای واقعی استفاده از مدل.
بنچمارکهای رسمی OpenAI درباره GPT-6 Astra چه میگویند؟
اوپنایآی برای نشاندادن توانایی GPT-6 Astra مجموعهای از بنچمارکها را در حوزههایی مانند کار با کامپیوتر، مهندسی نرمافزار، ریاضیات، علوم و امنیت سایبری منتشر کرده است.
نکته مهم این است که این نتایج فقط استرا را با نسل قبلی اوپنایآی مقایسه نمیکنند و در تعدادی از آزمونها، مدلهای رقیبی مانند Claude Fable 5.1، Claude Opus 5 و Gemini 3.8 Flash نیز حضور دارند.
این موضوع تصویر کاملتری از جایگاه استرا ارائه میدهد؛ مقایسه با GPT-5.6 Sol نشان میدهد اوپنایآی در یک نسل چقدر پیشرفت کرده است، درحالیکه مقایسه با مدلهای رقیب مشخص میکند این پیشرفت برای رسیدن به صدر بازار کافی بوده یا نه.
بنچمارک | چه چیزی را ارزیابی میکند؟ | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
OSWorld 2.0 | کار با کامپیوتر و انجام وظایف چندمرحلهای | ۷۲٫۶٪ | ۶۵٫۷٪ | — | — | — |
Terminal-Bench 4.0 | کار با ترمینال و وظایف مهندسی نرمافزار | ۵۷٫۹٪ | ۳۷٫۳٪ | ۵۵٫۸٪ | ۵۲٫۶٪ | ۱۹٫۱٪ |
DeepSWE v1.1 | حل مسائل واقعی برنامهنویسی | ۷۴٫۱٪ | ۷۲٫۷٪ | ۶۷٫۴٪ | ۷۳٫۷٪ | ۷۳٫۸٪ |
FrontierCode 1.1 | توانایی کدنویسی پیشرفته | ۶۴٫۵ | ۶۰٫۶ | ۶۳٫۶ | ۶۳٫۶ | ۵۶٫۳ |
Terminal-Bench Science 0.1 | پژوهش علمی با ابزار و ترمینال | ۶۴٫۶٪ | ۲۲٫۴٪ | ۵۲٫۶٪ | ۳۰٪ | — |
FrontierMath Tier 4 v2 | حل مسائل دشوار ریاضی | ۹۷٫۶٪ | ۸۳٪ | ۸۷٫۸٪ | ۷۳٫۲٪ | — |
GPQA Diamond | استدلال علمی سطح بالا | ۹۶٪ | ۹۴٫۶٪ | ۹۳٫۷٪ | ۹۳٫۷٪ | ۹۵٫۳٪ |
ExploitBench | تولید اکسپلویت از آسیبپذیریهای شناختهشده | ۱۰۰٪ | ۷۸٫۵٪ | — | — | — |
ExploitGym | توانایی عملی در زنجیره اکسپلویت | ۴۲٫۴٪ | ۳۰٫۳٪ | — | — | — |
Humanity’s Last Exam + tools | استدلال عمومی بسیار دشوار | ۵۷٫۲٪ | — | ۶۵٪ | ۶۳٫۶٪ | — |
در مواردی که علامت «-» دیده میشود، سازنده مدل یا منبع ارزیابی امتیازی برای آن مدل در آن بنچمارک منتشر نکرده است. بنابراین نمیتوان از نبود عدد، درباره عملکرد مدل نتیجهگیری کرد.
اعداد رسمی اوپنایآی برای استرا الگوی نسبتاً واضحی را نشان میدهند؛ این مدل بیشترین قدرت خود را در کارهایی نشان میدهد که فقط به تولید پاسخ متنی محدود نیستند و باید ابزار استفاده کند، چند مرحله را پشت سر بگذارد یا در محیطی واقعیتر تصمیم بگیرد.
برای نمونه، در Terminal-Bench 4.0 فاصله استرا با GPT-5.6 Sol بسیار قابلتوجه است؛ ۵۷٫۹ درصد در برابر ۳۷٫۳ درصد. این اختلاف نشان میدهد یکی از مهمترین جهشهای نسل جدید اوپنایآی در کارهای عاملمحور و فنی اتفاق افتاده است.
اما مقایسه با رقبا تصویر جالبتری ارائه میدهد. استرا در همان Terminal-Bench فقط ۲٫۱ واحد درصد بالاتر از کلاد فیبل ۵٫۱ قرار دارد. در DeepSWE نیز اختلاف آن با Claude Opus 5 و Gemini 3.8 Flash بسیار کوچک است؛ یعنی در بعضی حوزههای برنامهنویسی، رقابت میان مدلهای مرزی بسیار نزدیکتر از چیزی است که صرفاً با مقایسه Astra و Sol به نظر میرسد.
در مقابل، FrontierMath یکی از آزمونهایی است که استرا در آن فاصله بیشتری ایجاد میکند. امتیاز ۹۷٫۶ درصدی آن بالاتر از فیبل ۵٫۱ با ۸۷٫۸ درصد و Opus 5 با ۷۳٫۲ درصد قرار میگیرد و یکی از قویترین نتایج گزارششده برای مدل جدید اوپنایآی محسوب میشود.
امنیت سایبری نیز یکی از حوزههایی است که استرا در آن توانایی بالایی نشان میدهد. اوپنایآی اعلام کرده این مدل نخستین مدل این شرکت است که در چارچوب آمادگی امنیت سایبری به سطح «بحرانی» رسیده و در بنچمارک ExploitBench امتیاز ۱۰۰ درصدی کسب کرده است. بااینحال، همین تواناییها اهمیت کنترل و نظارت را بیشتر میکنند؛ زیرا مدلهایی که میتوانند آسیبپذیریها را تحلیل کنند و با کد و سیستمهای واقعی کار کنند، به ارزیابیهای ایمنی دقیقتری نیاز دارند.
بااینحال، حتی جدول خود اوپنایآی هم از این ادعا حمایت نمیکند که استرا در همهچیز بهترین مدل است. در Humanity’s Last Exam همراه با ابزار که دانش و استدلال بسیار دشوار با کمک ابزارها را میسنجد، کلاد فیبل ۵٫۱ با امتیاز ۶۵ درصد و Claude Opus 5 با ۶۳٫۶ درصد بالاتر از استرا با ۵۷٫۲ درصد قرار گرفتهاند. بنابراین نتیجه بسته به نوع مسئله میتواند کاملاً تغییر کند.
استرا نسبت به GPT-5.6 Sol جهش واضحی داشته است
در مجموع، دادههای رسمی نشان میدهند استرا نسبت به GPT-5.6 Sol یک جهش واضح، بهخصوص در استفاده از ابزارها، ترمینال و برخی وظایف علمی و ریاضی داشته است. اما وقتی مدلهای رقیب را هم وارد مقایسه میکنیم، دیگر با یک پیروزی یکطرفه روبهرو نیستیم؛ استرا یکی از مدلهای صدر بازار است، نه مدلی که در تمام آزمونها با فاصله از رقبا جلو افتاده باشد.
اینها نتایجی هستند که اوپنایآی منتشر کرده است. شرکت توضیح میدهد که ارزیابیها در محیط پژوهشی یا از طریق API انجام شدهاند و عواملی مانند دستور سیستمی (System Prompt)، ابزارهای در دسترس مدل و سطح تلاش استدلالی میتوانند روی امتیاز نهایی تأثیر بگذارند. به همین دلیل، برای فهم جایگاه استرا فقط نمیتوان به جدولهای سازنده اکتفا کرد. باید دید وقتی مدلها در چارچوبی مستقلتر و با روش مشترک سنجیده میشوند، آیا نتیجه همچنان به همین اندازه به نفع استرا باقی میماند یا نه.
بنچمارکهای مستقل درباره GPT-6 Astra چه میگویند؟
نتایج رسمی اوپنایآی نشان میدهند GPT-6 Astra نسبت به نسل قبل پیشرفت قابل توجهی داشته و در بسیاری از آزمونهای تخصصی عملکردی در سطح بهترین مدلهای موجود دارد. اما برای فهم جایگاه واقعی استرا، باید آن را در ارزیابیهایی بررسی کرد که توسط سازنده مدل طراحی نشدهاند.
ارزیابیهای مستقل معمولاً یک سؤال متفاوت را پاسخ میدهند، اینکه وقتی همه مدلهای قدرتمند بازار در شرایط مشابه قرار میگیرند، استرا کجا میایستد. سه دسته ارزیابی در این زمینه اهمیت بیشتری دارند؛ شاخصهای ترکیبی هوش، آزمونهای تعمیم و حل مسئله و ارزیابیهای مبتنی بر ترجیح کاربران.
Artificial Analysis؛ سنجش هوش کلی نشان میدهد Astra بیرقیب نیست
یکی از مهمترین ارزیابیهای مستقل برای مقایسه مدلهای هوش مصنوعی، Artificial Analysis Intelligence Index است؛ شاخصی ترکیبی که تلاش میکند توانایی کلی مدلها را در مجموعهای از آزمونهای مختلف، از استدلال و دانش گرفته تا تواناییهای فنی، در قالب یک امتیاز واحد مقایسه کند.
در نسخه ۴٫۲ شاخص Artificial Analysis، مدل GPT-6 Astra در حالت Max امتیاز ۵۵ را به دست آورده است؛ نتیجهای بالاتر از GPT-5.6 Sol با امتیاز ۵۱، اما پایینتر از فیبل ۵٫۱ با امتیاز ۵۷.
مدل | Intelligence Index v4.2 | هزینه تقریبی هر وظیفه در AA |
|---|---|---|
Claude Fable 5.1 Max | ۵۷ | ۶٫۱۲ دلار |
GPT-6 Astra Max | ۵۵ | ۲٫۵۷ دلار |
Claude Opus 5 Max | ۵۴ | ۴٫۲۱ دلار |
Muse Spark 1.3 Max | ۵۳ | ۰٫۹۶ دلار |
Kimi K3 Max | ۵۰ | ۱٫۵۸ دلار |
Gemini 3.8 Flash High | ۴۷ | ۰٫۷۴ دلار |
استرا نسبت به نسل قبل خود یک جهش محسوب میشود، اما در سنجشی که مدلهای مختلف را کنار هم قرار میدهد، فیبل ۵٫۱ همچنان دو امتیاز بالاتر قرار دارد و Claude Opus 5 نیز فاصله کمی با آن دارد.
برتری فیبل ۵٫۱ در Intelligence Index با هزینه بیشتری همراه است
از سوی دیگر، برتری فیبل ۵٫۱ در این شاخص با هزینه بیشتری همراه است. Artificial Analysis هزینه تقریبی اجرای هر وظیفه را برای فیبل ۵٫۱ حدود ۶٫۱۲ دلار و برای استرا حدود ۲٫۵۷ دلار برآورد کرده است. در میان مدلهای جدول، برخی گزینههای ارزانتر نیز وجود دارند که نسبت هزینه به عملکرد متفاوتی ارائه میکنند.
سرعت خروجی نیز تصویر کاملتری از جایگاه استرا ارائه میدهد. GPT-6 Astra Max با سرعت حدود ۷۱ توکن در ثانیه پاسخ تولید میکند؛ عددی که تقریباً همسطح Claude Fable 5.1 Max با حدود ۷۰ توکن در ثانیه است، اما از GPT-5.6 Sol Max با حدود ۸۵ توکن در ثانیه پایینتر قرار میگیرد. این تفاوت نشان میدهد استرا برای رسیدن به توانایی بالاتر، الزاماً سریعترین مدل موجود نیست. بنابراین مقایسه مدلها فقط بر اساس امتیاز Intelligence Index کافی نیست و عواملی مانند هزینه و سرعت پاسخگویی نیز در انتخاب مدل مناسب نقش دارند.
به همین دلیل، امتیاز هوش کلی تنها یکی از معیارهای انتخاب مدل است. در کاربردهای واقعی، نسبت توانایی به هزینه اهمیت زیادی دارد؛ چون ممکن است یک مدل با امتیاز کمی پایینتر، به دلیل قیمت یا سرعت بهتر انتخاب منطقیتری باشد.
در کاربردهای واقعی، نسبت توانایی به هزینه اهمیت زیادی دارد
همین ملاحظه در مقایسه مستقل استرا با نسل قبلی اوپنایآی نیز دیده میشود. استرا در Intelligence Index امتیاز بالاتری از نسل قبل خود کسب کرده، اما این افزایش توانایی با هزینه بیشتر و در برخی سنجشها با سرعت پایینتر همراه است. بنابراین Astra را باید مدلی توانمندتر دانست، نه لزوماً گزینهای بهتر برای همه کاربران و همه سناریوها.
بنچمارک ARC-AGI-3؛ چرا امتیازهای استرا متفاوت است؟
یکی از چشمگیرترین نتایج GPT-6 Astra در بنچمارک ARC-AGI-3 ثبت شده است؛ آزمونی که توسط ARC Prize توسعه داده شده و هدف آن سنجش توانایی مدلها در تعمیم، یادگیری از محیطهای جدید و حل مسئله در شرایطی است که پاسخ از قبل در دادههای آموزشی مدل وجود ندارد.
OpenAI برای Astra امتیاز ۹۹٫۹ درصدی گزارش کرده است؛ عددی که با توجه به بحثهای مطرحشده درباره نزدیکشدن مدلهای هوش مصنوعی به AGI، در نگاه اول بسیار چشمگیر به نظر میرسد. بااینحال، این امتیاز به شرایط اجرای آزمون وابسته است و تنها عددی نیست که برای ارزیابی Astra باید در نظر گرفت.
در هارنس استاندارد و مستقل از ارائهدهنده (Provider-Neutral)، استرا با سطح استدلال Max امتیاز ۶۲٫۷ درصد گرفته است. در مقابل، امتیاز ۹۹٫۹ درصد مربوط به اجرای استرا با سطح استدلال High در هارنسی است که از Provider Adapter استفاده میکند.
روش ارزیابی | مدل و سطح استدلال | امتیاز |
|---|---|---|
هارنس استاندارد و مستقل از ارائهدهنده | GPT-6 Astra Max | ۶۲٫۷٪ |
هارنس مجهز به Provider Adapter | GPT-6 Astra High | ۹۹٫۹٪ |
تفاوت این دو نتیجه به نحوه اجرای مدل برمیگردد. Provider Adapter امکان حفظ وضعیت استدلال و فرایند فشردهسازی (Compaction) میان درخواستها را فراهم میکند؛ درحالیکه هارنس استاندارد با هدف مقایسه مدلها در شرایط یکسان و مستقل از سازنده طراحی شده است.
نمیتوان ادعای OpenAI درباره «عصر AGI» را صرفاً با استناد به یک تأیید یا رد کرد
بنابراین، این دو امتیاز را نباید دو اندازهگیری کاملاً مشابه از توانایی استرا دانست. امتیاز ۹۹٫۹ درصدی نشاندهنده عملکرد مدل در شرایطی است که از Provider Adapter استفاده شده، درحالیکه نتیجه ۶۲٫۷ درصد تصویر عملکرد استرا در محیط استانداردتر و قابل مقایسهتر را ارائه میدهد.
این تفاوت یک نکته مهم درباره بنچمارکهای مدلهای پیشرفته را نشان میدهد: نتیجه فقط به خود مدل وابسته نیست؛ روش اجرای آزمون، ابزارهای در دسترس، حفظ وضعیت بین درخواستها و نحوه مدیریت کانتکست هم میتوانند روی امتیاز نهایی تأثیر بگذارند.
در نتیجه، نمیتوان ادعای OpenAI درباره نزدیکشدن به «عصر AGI» را صرفاً با استناد به یک امتیاز ۹۹٫۹ درصدی تأیید یا رد کرد. ارزیابی استرا نیازمند کنار هم گذاشتن نتایج استاندارد، تجربه استفاده واقعی و محدودیتهای روشهای سنجش است.
Code Arena WebDev؛ آزمونی نزدیکتر به تجربه واقعی توسعهدهندگان
یکی از تفاوتهای مهم ارزیابیهای Arena با بنچمارکهای سنتی این است که بهجای اندازهگیری یک توانایی مشخص، کاربران واقعی خروجی مدلها را با هم مقایسه میکنند.
استرا در Code Arena WebDev که مدلها را در وظایف توسعه وب و گردشکارهای کدنویسی عاملمحور با رأی کاربران رتبهبندی میکند، اهمیت ویژهای دارد، چون یکی از مهمترین وعدههای اوپنایآی درباره این مدل، توانایی در توسعه نرمافزار و انجام وظایف عاملمحور است.
در اسنپشات ۵ سپتامبر ۲۰۲۶ کدآرنا، GPT-6 Astra Max با امتیاز ۱۷۹۷ در رتبه نخست قرار دارد، اما بازهی امتیاز آن با فیبل ۵٫۱ همپوشانی دارد و از نظر آماری قطعی نیست؛ زیرا بازهی رتبهای هر دو مدل (Rank Spread) بین رتبهی ۱ تا ۲ قرار دارد. این یعنی با در نظر گرفتن عدمقطعیت امتیازها، هر دو مدل همچنان میتوانند در جایگاه اول یا دوم قرار بگیرند.
بنابراین نمیتوان نتیجه قطعی گرفت که استرا رقیب خود را شکست داده؛ بلکه میتوان گفت که استرا در یکی از مهمترین سناریوهای کاربردی خود، یعنی تولید خروجیهای توسعه وب، در بالاترین سطح رقابت قرار دارد.
جدول Code Arena بر رأی و مقایسه خروجیها در وظایف توسعه وب متکی است و جای آزمایش کنترلشدهی آزمایشگاهی را نمیگیرد؛ اما برای فهم عملکرد مدل در خروجیهای واقعیتر توسعه وب، سیگنال مفیدی است.
استرا کجا میدرخشد؟
اگر نتایج ارزیابیهای مستقل را در کنار یکدیگر قرار دهیم، تصویری متعادلتر از جایگاه Astra به دست میآید:
- در کارهای عاملمحور، کدنویسی و استفاده از ابزارها: استرا عملکردی در سطح بهترین مدلهای موجود دارد و در برخی ارزیابیها به رتبههای برتر میرسد.
- در سنجش هوش کلی: استرا در جمع قدرتمندترین مدلهای حال حاضر قرار دارد، اما نتایج همه ارزیابیها برتری مطلق آن را تأیید نمیکنند.
- در آزمونهایی مانند ARC-AGI: استرا به نتایج بسیار چشمگیری میرسد، اما همانطور که دیدیم، تفسیر این نتایج به روش اجرای آزمون و شرایط ارزیابی وابسته است.
- در ارزیابیهای مبتنی بر ترجیح کاربران: استرا نشان میدهد خروجیهای آن در تعاملات واقعی میتواند با بهترین مدلهای رقیب رقابت کند.
در مجموع، ارزیابیهای مستقل تصویری از مدلی ارائه میدهند که در طیف گستردهای از وظایف عملکردی بسیار قدرتمند دارد، اما نمیتوان جایگاه آن را با یک بنچمارک یا یک رتبه واحد خلاصه کرد.
نقطه قوت اصلی استرا، ترکیب استدلال، کدنویسی، ابزار و انجام وظایف چندمرحلهای برای حل مسائل واقعی است
نقطه قوت اصلی استرا در ترکیب توانایی استدلال، کدنویسی، استفاده از ابزار و انجام وظایف چندمرحلهای است؛ حوزههایی که بیش از یک امتیاز بنچمارک، به توانایی مدل برای انجام کارهای واقعی نزدیک هستند.
در یک جمله، استرا قدرتمندترین مدل اوپنایآی تا امروز است؛ اما اهمیت واقعی آن شاید نه در اینکه چند رقیب را شکست میدهد، بلکه در این باشد که چقدر ما را به هوش مصنوعیای نزدیک میکند که بتواند کارهای واقعی را بهجای ما انجام دهد.
تجربه کاربران از GPT-6 Astra چه میگوید؟
اعداد بنچمارکها فقط بخشی از داستان GPT-6 استرا هستند. تجربه کاربران اولیه نشان میدهد مهمترین تفاوت این مدل با نسلهای قبل، بیشتر در توانایی انجام کارهای چندمرحلهای دیده میشود تا صرفاً بهتر جواب دادن.
بازخوردهای اولیه توسعهدهندگان و کاربران حرفهای بیشتر روی کارهایی مانند تحلیل پروژههای بزرگتر، اصلاح کد، دنبال کردن مسیرهای طولانی و استفاده از ابزارها بوده است. برای این دسته از کاربران، استرا کمتر شبیه یک چتبات و بیشتر شبیه یک دستیار اجرایی عمل میکند.
هزینه استفاده، سرعت پاسخگویی و نیاز به بررسی خروجیها همچنان از مهمترین نگرانیها هستند
بااینحال، تجربه واقعی کاربران یک تصویر کاملاً بینقص ارائه نمیکند. هزینه استفاده، سرعت پاسخگویی و نیاز به بررسی خروجیها همچنان از مهمترین نگرانیها هستند. حتی زمانی که استرا بتواند بخش بزرگی از یک کار را انجام دهد، کاربران همچنان مجبورند تصمیمهای مهم را بررسی و نتیجه نهایی را کنترل کنند.
یکی دیگر از بحثهای مطرحشده در روزهای ابتدایی عرضه، تجربه نامنظم برخی کاربران از دسترسی و ظرفیت سرویس بود؛ مسئلهای که نشان داد عرضه یک مدل مرزی در مقیاس میلیونها کاربر، به اندازه ساخت خود مدل چالشبرانگیز است.
در مجموع، بازخوردهای اولیه بیشتر به این نتیجه مشترک میرسند که استرا جهشی مهم در مسیر دستیارهای هوشمند است، اما تجربه فعلی آن بیشتر شبیه یک «همکار دیجیتال بسیار قدرتمند» است تا هوش عمومی مستقل.
قیمت و روش دسترسی به GPT-6 Astra
GPT-6 Astra در دسته مدلهای حرفهای اوپنایآی قرار میگیرد و قیمت آن نشان میدهد این مدل بیشتر برای کارهای پیچیده مانند توسعه نرمافزار، استفاده از ابزارها، پژوهش و گردشکارهای چندمرحلهای طراحی شده است.
قیمت استاندارد API این مدل به ازای هر یک میلیون توکن به شکل زیر است:
نوع مصرف | قیمت بهازای هر یک میلیون توکن |
|---|---|
ورودی | ۱۰ دلار |
ورودی کششده | ۱ دلار |
Cache write | ۱۲٫۵۰ دلار |
خروجی | ۵۰ دلار |
درخواستهایی که بیش از ۲۷۲ هزار توکن ورودی داشته باشند، با تعرفه متفاوت محاسبه میشوند؛ در این حالت هزینه توکنهای ورودی و کششده دو برابر و هزینه توکنهای خروجی ۱٫۵ برابر نرخ معمول خواهد بود. این موضوع برای استرا اهمیت زیادی دارد، چون مدل از پنجره کانتکست ۱٫۰۵ میلیون توکنی پشتیبانی میکند، اما استفاده از بخشهای بسیار طولانی این ظرفیت الزاماً با همان هزینه پایه انجام نمیشود.
اوپنایآی برای پردازشهایی که نیاز به پاسخ فوری ندارند، حالتهای Batch و Flex را با هزینه پایینتر ارائه میکند. در مقابل، حالت Fast برای کاهش زمان پاسخ طراحی شده و هزینه بیشتری دارد. البته Fast برای استرا در حالت EU data residency در دسترس نیست؛ محدودیتی که بیشتر برای مشتریان سازمانی با الزامات محل پردازش و نگهداری داده اهمیت دارد.
مقایسه قیمت Astra با GPT-5.6 Sol و Claude Fable 5.1
از نظر قیمت رسمی API، استرا نسبت به نسل قبلی خود مدل گرانتری محسوب میشود. استفاده از استرا نسبت به Sol حدود ۲٫۵ برابر گرانتر است؛ چه در هزینه ورودی و چه خروجی. در مقابل، قیمت پایه استرا تقریباً همسطح کلاد فیبل ۵٫۱ قرار میگیرد.
مدل | ورودی | خروجی |
|---|---|---|
GPT-6 Astra | ۱۰ دلار | ۵۰ دلار |
GPT-5.6 Sol | ۴ دلار | ۲۰ دلار |
Claude Fable 5.1 | ۱۰ دلار | ۵۰ دلار |
اما قیمت هر توکن تنها بخشی از هزینه واقعی است. در مدلهای عاملمحور، تعداد توکنهای مصرفی، فراخوانی ابزارها و طول گردشکار هم روی هزینه نهایی اثر میگذارند. بنابراین برای انتخاب مدل، باید تعادل میان کیفیت خروجی، سرعت و هزینه نهایی انجام کار را همزمان در نظر گرفت.
نحوه دسترسی به استرا
دسترسی به GPT-6 Astra بسته به نوع کاربر و روش استفاده متفاوت است. استرا از طریق اوپنایآی API با شناسهی gpt-6-astra در اختیار توسعهدهندگان قرار گرفته است و اوپنایآی ارائهی آن از طریق Microsoft Azure و AWS Bedrock را نیز اعلام کرده است. در API، این مدل برای سطح رایگان (Free tier) پشتیبانی نمیشود.
برای کاربران عادی، استرا از طریق ChatGPT ارائه میشود و دسترسی به آن بهصورت تدریجی فعال میشود. کاربران پلنهای پولی ChatGPT مانند Plus، Pro، Business و Enterprise میتوانند بسته به نوع حساب، منطقه، ظرفیت سرویس و سیاست عرضه اوپنایآی به این مدل دسترسی پیدا کنند.
در محیطهای سازمانی نیز مدیران Workspace میتوانند دسترسی کاربران به مدل را مدیریت کنند و محدودیتهای استفاده به نوع پلن و سیاستهای اوپنایآی بستگی دارد.
آیا GPT-6 Astra به AGI نزدیک شده است؟
GPT-6 Astra با وجود تواناییهای چشمگیر، هنوز فاصلهای میان «مدل بسیار قدرتمند» و «هوش عمومی مستقل» دارد. این مدل میتواند با کامپیوتر کار کند، ابزارها را به کار بگیرد، کد بنویسد و وظایف چندمرحلهای را انجام دهد؛ اما همین تواناییها به معنی رسیدن به هوشی همسطح انسان نیستند.
یکی از مهمترین محدودیتهای استرا، هزینه و پیچیدگی استفاده از آن است. این مدل برای رسیدن به کیفیت بالاتر معمولاً منابع بیشتری مصرف میکند و در برخی سنجشها سرعت پایینتری نسبت به مدلهای قبلی دارد؛ موضوعی که برای استفاده گسترده در محصولات و سرویسها اهمیت زیادی پیدا میکند.
از طرف دیگر، افزایش تواناییهای عاملمحور استرا مانند کار با کامپیوتر، اجرای کد و تعامل با سیستمهای واقعی، نیاز به کنترل و نظارت را بیشتر میکند. هرچه مدل اختیار بیشتری برای انجام کار داشته باشد، مدیریت دسترسی، بررسی خروجیها و کنترل خطاها اهمیت بیشتری پیدا میکند.
اما آیا این یعنی استرا آغاز عصر AGI است؟ پاسخ به تعریف ما از AGI بستگی دارد.
استرا نشان میدهد که مسیر هوش مصنوعی از پاسخ دادن به سمت انجام دادن حرکت کرده است
اگر AGI را سیستمی بدانیم که میتواند طیف گستردهای از کارهای دیجیتال را انجام دهد، استرا یکی از نزدیکترین مدلهای تجاری به این ایده است. نتایج بنچمارکها، قابلیت استفاده از ابزارها و توانایی انجام وظایف پیچیده نشان میدهند مدلهای زبانی وارد مرحله تازهای شدهاند.
بااینحال، اگر AGI را به معنای هوشی همسطح انسان با درک عمومی، تصمیمگیری مستقل و عملکرد قابل اعتماد در شرایط ناشناخته بدانیم، دادههای فعلی هنوز چنین نتیجهای را ثابت نمیکنند.
شاید مهمترین تغییر استرا این نباشد که آیا امروز AGI محسوب میشود یا نه؛ بلکه این است که نشان میدهد مسیر هوش مصنوعی از «پاسخ دادن» به سمت «انجام دادن» حرکت کرده است.
اگر به GPT-6 Astra دسترسی پیدا کردهاید، تجربه خودتان را درباره سرعت، دقت و توانایی انجام کارهای چندمرحلهای با ما و دیگر کاربران زومیت به اشتراک بگذارید. به نظر شما مهمترین تغییر استرا چیست: هوش بالاتر، توانایی انجام کارها یا نزدیکتر شدن به AGI؟