وقتی OpenAI از GPT-6 Astra رونمایی کرد، فقط از یک مدل زبانی جدید حرف نزد؛ این شرکت مدعی شد هوش مصنوعی وارد مرحله‌ای تازه شده است. گرگ براکمن، رئیس اوپن‌ای‌آی، گفت شاید سال‌ها بعد همین دوره زمانی به‌عنوان یکی از نقاط آغاز عصر AGI شناخته شود؛ ادعایی که GPT-6 Astra را از یک ارتقای معمولی در دنیای مدل‌های زبانی جدا می‌کند.

اما دلیل اهمیت استرا فقط این ادعای بزرگ نیست. این مدل قرار است مرز میان «پرسیدن از هوش مصنوعی» و «سپردن کار به هوش مصنوعی» را جابه‌جا کند. اوپن‌ای‌آی می‌گوید استرا می‌تواند با کامپیوتر کار کند، بین نرم‌افزارها حرکت کند، ابزارها را به کار بگیرد، کد بنویسد، وب را جست‌وجو کند و وظایف چندمرحله‌ای را تا رسیدن به نتیجه دنبال کند.

دموهای اولیه اوپن‌ای‌آی هم دقیقاً روی همین ایده تمرکز داشتند؛ جایی که استرا با فرمان صوتی می‌تواند از یک ایده ساده، خروجی‌های پیچیده‌تری مثل طراحی، ساخت نمونه نرم‌افزاری یا انجام کارهای واقعی در سرویس‌های مختلف ایجاد کند. همین قابلیت‌ها باعث شده برخی آن را نزدیک‌ترین قدم اوپن‌ای‌آی به ایده یک عامل هوشمند عمومی بدانند.

اما بین یک نمایش خیره‌کننده و یک تغییر واقعی در دنیای فناوری فاصله وجود دارد. امتیازهای بالای بنچمارک‌ها همیشه به معنی عملکرد بهتر در دنیای واقعی نیستند؛ همان‌طور که هزینه، سرعت، محدودیت‌های ایمنی و تجربه کاربران هم بخشی از تصویر هستند.

GPT-6 Astra چیست و چرا مهم است؟

GPT-6 Astra (استرا) مدل پرچمدار جدید OpenAI است که در ۳ سپتامبر ۲۰۲۶ معرفی شد. این مدل در API با شناسه gpt-6-astra عرضه شده و برای کارهایی مانند استفاده از کامپیوتر، مرور وب، مهندسی نرم‌افزار، امنیت سایبری، علوم و فعالیت‌های حرفه‌ای طراحی شده است.

تفاوت اصلی استرا با بسیاری از نسل‌های قبلی مدل‌های زبانی، رویکرد عامل‌محور آن است. این مدل فقط برای تولید پاسخ بهتر ساخته نشده؛ بلکه می‌تواند یک هدف را دریافت کند، مراحل لازم را برنامه‌ریزی کند، از ابزارها استفاده کند و در طول مسیر تصمیم‌های جدید بگیرد.

یکی از مهم‌ترین ویژگی‌های فنی استرا، پنجره کانتکست ۱٫۰۵ میلیون‌توکنی آن است؛ ظرفیتی که به توسعه‌دهندگان اجازه می‌دهد حجم بزرگی از متن، فایل یا اطلاعات یک پروژه را در اختیار مدل قرار دهند. البته ظرفیت بیشتر به‌تنهایی تضمین نمی‌کند مدل همیشه در پروژه‌های بسیار طولانی دقت و انسجام کامل داشته باشد.

استرا همچنین مجموعه گسترده‌ای از قابلیت‌های ابزاری را در اختیار توسعه‌دهندگان قرار می‌دهد. این مدل از فراخوانی تابع (Function Calling)، خروجی‌های ساختاریافته (Structured Outputs) و ابزارهای مختلف Responses API پشتیبانی می‌کند؛ ابزارهایی مانند جست‌وجوی وب و فایل، اجرای کد، شل میزبانی‌شده، اعمال تغییرات کد، استفاده از کامپیوتر، MCP و جست‌وجوی ابزارها.

استرا با قابلیت‌های ابزارمحور گسترده، برای انجام وظایف پیچیده و چندمرحله‌ای طراحی شده است.

دو قابلیت جدید نیز نقش مهمی در طراحی عامل‌محور استرا دارند. Async Tool Calling اجازه می‌دهد مدل هنگام اجرای یک ابزار زمان‌بر، کاملاً متوقف نشود و بخش‌های دیگری از کار را ادامه دهد.

Mid-turn Steering نیز امکان تغییر مسیر اجرای وظیفه را در میانه کار فراهم می‌کند؛ قابلیتی که برای گردش‌کارهای طولانی و پیچیده اهمیت زیادی دارد.

در کنار این قابلیت‌ها، استرا چند سطح مختلف برای میزان تلاش استدلالی ارائه می‌دهد؛ از Low تا Max. توسعه‌دهندگان می‌توانند بر اساس نوع وظیفه، بین کیفیت، سرعت و هزینه تعادل ایجاد کنند. البته اوپن‌ای‌آی جزئیات دقیقی درباره اینکه هر سطح استدلال در شرایط مختلف چه تأثیری روی عملکرد نهایی دارد منتشر نکرده است.

مشخصات فنی استرا

ویژگی

مشخصات

سازنده

OpenAI

تاریخ معرفی

۳ سپتامبر ۲۰۲۶

شناسه API

gpt-6-astra

پنجره کانتکست

۱٬۰۵۰٬۰۰۰ توکن

حداکثر خروجی

۱۲۸٬۰۰۰ توکن

ورودی

متن و تصویر

خروجی

متن

تاریخ آخرین به‌روزرسانی دانش (Knowledge cutoff)

۳۰ آوریل ۲۰۲۶

سطح تلاش استدلالی (Reasoning effort)

low، medium، high، xhigh و max

فراخوانی تابع (Function calling)

پشتیبانی می‌شود

خروجی‌های ساختاریافته (Structured Outputs)

پشتیبانی می‌شود

تنظیم دقیق مدل (Fine-tuning)

پشتیبانی نمی‌شود

قیمت ورودی در Standard API

۱۰ دلار / یک میلیون توکن

قیمت خروجی در Standard API

۵۰ دلار / یک میلیون توکن

وضعیت در ChatGPT

عرضه تدریجی برای حساب‌ها و پلن‌های واجدشرایط پولی

مهم‌ترین تغییر Astra را باید در قابلیت‌های عامل‌محور آن جست‌وجو کرد؛ مدلی که به‌جای صرفاً توضیح دادن مراحل انجام یک کار، می‌تواند بخشی از آن را خودش اجرا کند.

یکی از شاخص‌ترین قابلیت‌های استرا، استفاده از کامپیوتر (Computer Use) است. مدل می‌تواند با صفحه‌نمایش، ماوس و کیبورد تعامل کند و کارهایی مانند پر کردن فرم‌ها، به‌روزرسانی CRM، مدیریت تقویم، جست‌وجوی وب، کار با فایل‌ها و حتی ساخت و آزمایش وب‌سایت‌ها را انجام دهد. این رویکرد می‌تواند نیاز به API، افزونه و اتصال‌های اختصاصی برای هر سرویس را کاهش دهد.

پخش از رسانه

این رویکرد می‌تواند شیوه تعامل کسب‌وکارها با هوش مصنوعی را تغییر دهد. در سال‌های اخیر، شرکت‌ها برای وصل کردن مدل‌های هوش مصنوعی به سیستم‌های داخلی خود مجبور بودند API، افزونه، کانکتور و لایه‌های نرم‌افزاری مختلف بسازند. استرا تلاش می‌کند بخشی از این پیچیدگی را با تعامل مستقیم با محیط کاربر کاهش دهد.

رویکرد آسترا می‌تواند شیوه تعامل کسب‌وکارها با هوش مصنوعی را تغییر دهد

در نتیجه، خروجی استرا دیگر لزوماً فقط یک متن نیست؛ کاربر می‌تواند هدفی را مشخص کند و مدل مجموعه‌ای از اقدامات را برای رسیدن به آن انجام دهد.

بااین‌حال، این قابلیت به معنی حذف کامل انسان از فرایند نیست و در کارهای حساس همچنان نظارت انسانی اهمیت دارد. ارزش اصلی استرا فعلاً در کاهش کارهای تکراری و چندمرحله‌ای و سپردن بخشی از اجرای آن‌ها به هوش مصنوعی است.

GPT-6 Astra در مقایسه با GPT-5.6 Sol چقدر بهتر شده است؟

مقایسه آسترا با GPT-5.6 Sol شاید منطقی‌ترین نقطه شروع برای سنجش پیشرفت این مدل باشد؛ چون نشان می‌دهد اوپن‌ای‌آی در یک نسل جدید چه مسیری را طی کرده است.

داده‌های موجود تصویر نسبتاً مشخصی ارائه می‌کنند؛ آسترا در بسیاری از وظایف پیچیده، به‌خصوص کارهایی که به استفاده از ابزار، اجرای چند مرحله و استدلال طولانی نیاز دارند، نسبت به Sol پیشرفت کرده است. اما این پیشرفت بدون هزینه نیست؛ در برخی ارزیابی‌های مستقل، آسترا سرعت پایین‌تر و هزینه بیشتری نسبت به نسل قبل داشته است.

آسترا در بسیاری از وظایف پیچیده نسبت به Sol پیشرفت کرده است

به بیان ساده، استرا بیشتر شبیه یک ارتقای هدفمند برای کارهای پیچیده است، نه یک جایگزین سریع‌تر و ارزان‌تر برای همه کاربران. اگر استفاده اصلی شما از هوش مصنوعی نوشتن متن، خلاصه‌سازی یا پرسش‌های روزمره باشد، اختلاف میان استرا و Sol احتمالاً به اندازه نتایج آزمایشگاهی محسوس نیست.

اما اگر مدل قرار است کد بنویسد، ابزار اجرا کند، فایل تحلیل کند یا یک گردش‌کار چندمرحله‌ای را مدیریت کند، تفاوت آن بیشتر دیده می‌شود.

قابلیت‌های ذکرشده استرا را بیشتر به معماری یک دستیار اجرایی نزدیک می‌کنند تا یک مدل پرسش‌وپاسخ ساده. اما آیا این توانایی‌ها در عمل به همان اندازه‌ای که در معرفی‌ها جذاب به نظر می‌رسند، قابل اعتماد هستند؟ پاسخ این سؤال را باید در ترکیب سه چیز پیدا کرد: نتایج آزمایش‌ها، تجربه کاربران و محدودیت‌های واقعی استفاده از مدل.

بنچمارک‌های رسمی OpenAI درباره GPT-6 Astra چه می‌گویند؟

اوپن‌ای‌آی برای نشان‌دادن توانایی GPT-6 Astra مجموعه‌ای از بنچمارک‌ها را در حوزه‌هایی مانند کار با کامپیوتر، مهندسی نرم‌افزار، ریاضیات، علوم و امنیت سایبری منتشر کرده است.

نکته مهم این است که این نتایج فقط استرا را با نسل قبلی اوپن‌ای‌آی مقایسه نمی‌کنند و در تعدادی از آزمون‌ها، مدل‌های رقیبی مانند Claude Fable 5.1، Claude Opus 5 و Gemini 3.8 Flash نیز حضور دارند.

این موضوع تصویر کامل‌تری از جایگاه استرا ارائه می‌دهد؛ مقایسه با GPT-5.6 Sol نشان می‌دهد اوپن‌ای‌آی در یک نسل چقدر پیشرفت کرده است، درحالی‌که مقایسه با مدل‌های رقیب مشخص می‌کند این پیشرفت برای رسیدن به صدر بازار کافی بوده یا نه.

بنچمارک

چه چیزی را ارزیابی می‌کند؟

GPT-6 Astra

GPT-5.6 Sol

Claude Fable 5.1

Claude Opus 5

Gemini 3.8 Flash

OSWorld 2.0

کار با کامپیوتر و انجام وظایف چندمرحله‌ای

۷۲٫۶٪

۶۵٫۷٪

Terminal-Bench 4.0

کار با ترمینال و وظایف مهندسی نرم‌افزار

۵۷٫۹٪

۳۷٫۳٪

۵۵٫۸٪

۵۲٫۶٪

۱۹٫۱٪

DeepSWE v1.1

حل مسائل واقعی برنامه‌نویسی

۷۴٫۱٪

۷۲٫۷٪

۶۷٫۴٪

۷۳٫۷٪

۷۳٫۸٪

FrontierCode 1.1

توانایی کدنویسی پیشرفته

۶۴٫۵

۶۰٫۶

۶۳٫۶

۶۳٫۶

۵۶٫۳

Terminal-Bench Science 0.1

پژوهش علمی با ابزار و ترمینال

۶۴٫۶٪

۲۲٫۴٪

۵۲٫۶٪

۳۰٪

FrontierMath Tier 4 v2

حل مسائل دشوار ریاضی

۹۷٫۶٪

۸۳٪

۸۷٫۸٪

۷۳٫۲٪

GPQA Diamond

استدلال علمی سطح بالا

۹۶٪

۹۴٫۶٪

۹۳٫۷٪

۹۳٫۷٪

۹۵٫۳٪

ExploitBench

تولید اکسپلویت از آسیب‌پذیری‌های شناخته‌شده

۱۰۰٪

۷۸٫۵٪

ExploitGym

توانایی عملی در زنجیره اکسپلویت

۴۲٫۴٪

۳۰٫۳٪

Humanity’s Last Exam + tools

استدلال عمومی بسیار دشوار

۵۷٫۲٪

۶۵٪

۶۳٫۶٪

در مواردی که علامت «-» دیده می‌شود، سازنده مدل یا منبع ارزیابی امتیازی برای آن مدل در آن بنچمارک منتشر نکرده است. بنابراین نمی‌توان از نبود عدد، درباره عملکرد مدل نتیجه‌گیری کرد.

اعداد رسمی اوپن‌ای‌آی برای استرا الگوی نسبتاً واضحی را نشان می‌دهند؛ این مدل بیشترین قدرت خود را در کارهایی نشان می‌دهد که فقط به تولید پاسخ متنی محدود نیستند و باید ابزار استفاده کند، چند مرحله را پشت سر بگذارد یا در محیطی واقعی‌تر تصمیم بگیرد.

برای نمونه، در Terminal-Bench 4.0 فاصله استرا با GPT-5.6 Sol بسیار قابل‌توجه است؛ ۵۷٫۹ درصد در برابر ۳۷٫۳ درصد. این اختلاف نشان می‌دهد یکی از مهم‌ترین جهش‌های نسل جدید اوپن‌ای‌آی در کارهای عامل‌محور و فنی اتفاق افتاده است.

اما مقایسه با رقبا تصویر جالب‌تری ارائه می‌دهد. استرا در همان Terminal-Bench فقط ۲٫۱ واحد درصد بالاتر از کلاد فیبل ۵٫۱ قرار دارد. در DeepSWE نیز اختلاف آن با Claude Opus 5 و Gemini 3.8 Flash بسیار کوچک است؛ یعنی در بعضی حوزه‌های برنامه‌نویسی، رقابت میان مدل‌های مرزی بسیار نزدیک‌تر از چیزی است که صرفاً با مقایسه Astra و Sol به نظر می‌رسد.

در مقابل، FrontierMath یکی از آزمون‌هایی است که استرا در آن فاصله بیشتری ایجاد می‌کند. امتیاز ۹۷٫۶ درصدی آن بالاتر از فیبل ۵٫۱ با ۸۷٫۸ درصد و Opus 5 با ۷۳٫۲ درصد قرار می‌گیرد و یکی از قوی‌ترین نتایج گزارش‌شده برای مدل جدید اوپن‌ای‌آی محسوب می‌شود.

امنیت سایبری نیز یکی از حوزه‌هایی است که استرا در آن توانایی بالایی نشان می‌دهد. اوپن‌ای‌آی اعلام کرده این مدل نخستین مدل این شرکت است که در چارچوب آمادگی امنیت سایبری به سطح «بحرانی» رسیده و در بنچمارک ExploitBench امتیاز ۱۰۰ درصدی کسب کرده است. بااین‌حال، همین توانایی‌ها اهمیت کنترل و نظارت را بیشتر می‌کنند؛ زیرا مدل‌هایی که می‌توانند آسیب‌پذیری‌ها را تحلیل کنند و با کد و سیستم‌های واقعی کار کنند، به ارزیابی‌های ایمنی دقیق‌تری نیاز دارند.

بااین‌حال، حتی جدول خود اوپن‌ای‌آی هم از این ادعا حمایت نمی‌کند که استرا در همه‌چیز بهترین مدل است. در Humanity’s Last Exam همراه با ابزار که دانش و استدلال بسیار دشوار با کمک ابزارها را می‌سنجد، کلاد فیبل ۵٫۱ با امتیاز ۶۵ درصد و Claude Opus 5 با ۶۳٫۶ درصد بالاتر از استرا با ۵۷٫۲ درصد قرار گرفته‌اند. بنابراین نتیجه بسته به نوع مسئله می‌تواند کاملاً تغییر کند.

استرا نسبت به GPT-5.6 Sol جهش واضحی داشته است

در مجموع، داده‌های رسمی نشان می‌دهند استرا نسبت به GPT-5.6 Sol یک جهش واضح، به‌خصوص در استفاده از ابزارها، ترمینال و برخی وظایف علمی و ریاضی داشته است. اما وقتی مدل‌های رقیب را هم وارد مقایسه می‌کنیم، دیگر با یک پیروزی یک‌طرفه روبه‌رو نیستیم؛ استرا یکی از مدل‌های صدر بازار است، نه مدلی که در تمام آزمون‌ها با فاصله از رقبا جلو افتاده باشد.

این‌ها نتایجی هستند که اوپن‌ای‌آی منتشر کرده است. شرکت توضیح می‌دهد که ارزیابی‌ها در محیط پژوهشی یا از طریق API انجام شده‌اند و عواملی مانند دستور سیستمی (System Prompt)، ابزارهای در دسترس مدل و سطح تلاش استدلالی می‌توانند روی امتیاز نهایی تأثیر بگذارند. به همین دلیل، برای فهم جایگاه استرا فقط نمی‌توان به جدول‌های سازنده اکتفا کرد. باید دید وقتی مدل‌ها در چارچوبی مستقل‌تر و با روش مشترک سنجیده می‌شوند، آیا نتیجه همچنان به همین اندازه به نفع استرا باقی می‌ماند یا نه.

بنچمارک‌های مستقل درباره GPT-6 Astra چه می‌گویند؟

نتایج رسمی اوپن‌ای‌آی نشان می‌دهند GPT-6 Astra نسبت به نسل قبل پیشرفت قابل توجهی داشته و در بسیاری از آزمون‌های تخصصی عملکردی در سطح بهترین مدل‌های موجود دارد. اما برای فهم جایگاه واقعی استرا، باید آن را در ارزیابی‌هایی بررسی کرد که توسط سازنده مدل طراحی نشده‌اند.

ارزیابی‌های مستقل معمولاً یک سؤال متفاوت را پاسخ می‌دهند، اینکه وقتی همه مدل‌های قدرتمند بازار در شرایط مشابه قرار می‌گیرند، استرا کجا می‌ایستد. سه دسته ارزیابی در این زمینه اهمیت بیشتری دارند؛ شاخص‌های ترکیبی هوش، آزمون‌های تعمیم و حل مسئله و ارزیابی‌های مبتنی بر ترجیح کاربران.

Artificial Analysis؛ سنجش هوش کلی نشان می‌دهد Astra بی‌رقیب نیست

یکی از مهم‌ترین ارزیابی‌های مستقل برای مقایسه مدل‌های هوش مصنوعی، Artificial Analysis Intelligence Index است؛ شاخصی ترکیبی که تلاش می‌کند توانایی کلی مدل‌ها را در مجموعه‌ای از آزمون‌های مختلف، از استدلال و دانش گرفته تا توانایی‌های فنی، در قالب یک امتیاز واحد مقایسه کند.

رتبه‌بندی مدل‌های زبانی بزرگ در شاخص تحلیل هوش مصنوعی که جایگاه GPT-6 Astra را در میان مدل‌های پیشرفته نشان می‌دهد.

در نسخه ۴٫۲ شاخص Artificial Analysis، مدل GPT-6 Astra در حالت Max امتیاز ۵۵ را به دست آورده است؛ نتیجه‌ای بالاتر از GPT-5.6 Sol با امتیاز ۵۱، اما پایین‌تر از فیبل ۵٫۱ با امتیاز ۵۷.

مدل

Intelligence Index v4.2

هزینه تقریبی هر وظیفه در AA

Claude Fable 5.1 Max

۵۷

۶٫۱۲ دلار

GPT-6 Astra Max

۵۵

۲٫۵۷ دلار

Claude Opus 5 Max

۵۴

۴٫۲۱ دلار

Muse Spark 1.3 Max

۵۳

۰٫۹۶ دلار

Kimi K3 Max

۵۰

۱٫۵۸ دلار

Gemini 3.8 Flash High

۴۷

۰٫۷۴ دلار

استرا نسبت به نسل قبل خود یک جهش محسوب می‌شود، اما در سنجشی که مدل‌های مختلف را کنار هم قرار می‌دهد، فیبل ۵٫۱ همچنان دو امتیاز بالاتر قرار دارد و Claude Opus 5 نیز فاصله کمی با آن دارد.

برتری فیبل ۵٫۱ در Intelligence Index با هزینه بیشتری همراه است

از سوی دیگر، برتری فیبل ۵٫۱ در این شاخص با هزینه بیشتری همراه است. Artificial Analysis هزینه تقریبی اجرای هر وظیفه را برای فیبل ۵٫۱ حدود ۶٫۱۲ دلار و برای استرا حدود ۲٫۵۷ دلار برآورد کرده است. در میان مدل‌های جدول، برخی گزینه‌های ارزان‌تر نیز وجود دارند که نسبت هزینه به عملکرد متفاوتی ارائه می‌کنند.

نمودار تحلیل هزینه‌های پردازشی مدل‌های مختلف هوش مصنوعی برای انجام وظایف تحلیل مصنوعی (Artificial Analysis).

سرعت خروجی نیز تصویر کامل‌تری از جایگاه استرا ارائه می‌دهد. GPT-6 Astra Max با سرعت حدود ۷۱ توکن در ثانیه پاسخ تولید می‌کند؛ عددی که تقریباً هم‌سطح Claude Fable 5.1 Max با حدود ۷۰ توکن در ثانیه است، اما از GPT-5.6 Sol Max با حدود ۸۵ توکن در ثانیه پایین‌تر قرار می‌گیرد. این تفاوت نشان می‌دهد استرا برای رسیدن به توانایی بالاتر، الزاماً سریع‌ترین مدل موجود نیست. بنابراین مقایسه مدل‌ها فقط بر اساس امتیاز Intelligence Index کافی نیست و عواملی مانند هزینه و سرعت پاسخ‌گویی نیز در انتخاب مدل مناسب نقش دارند.

به همین دلیل، امتیاز هوش کلی تنها یکی از معیارهای انتخاب مدل است. در کاربردهای واقعی، نسبت توانایی به هزینه اهمیت زیادی دارد؛ چون ممکن است یک مدل با امتیاز کمی پایین‌تر، به دلیل قیمت یا سرعت بهتر انتخاب منطقی‌تری باشد.

در کاربردهای واقعی، نسبت توانایی به هزینه اهمیت زیادی دارد

همین ملاحظه در مقایسه مستقل استرا با نسل قبلی اوپن‌ای‌آی نیز دیده می‌شود. استرا در Intelligence Index امتیاز بالاتری از نسل قبل خود کسب کرده، اما این افزایش توانایی با هزینه بیشتر و در برخی سنجش‌ها با سرعت پایین‌تر همراه است. بنابراین Astra را باید مدلی توانمندتر دانست، نه لزوماً گزینه‌ای بهتر برای همه کاربران و همه سناریوها.

بنچمارک ARC-AGI-3؛ چرا امتیازهای استرا متفاوت است؟

یکی از چشمگیرترین نتایج GPT-6 Astra در بنچمارک ARC-AGI-3 ثبت شده است؛ آزمونی که توسط ARC Prize توسعه داده شده و هدف آن سنجش توانایی مدل‌ها در تعمیم، یادگیری از محیط‌های جدید و حل مسئله در شرایطی است که پاسخ از قبل در داده‌های آموزشی مدل وجود ندارد.

OpenAI برای Astra امتیاز ۹۹٫۹ درصدی گزارش کرده است؛ عددی که با توجه به بحث‌های مطرح‌شده درباره نزدیک‌شدن مدل‌های هوش مصنوعی به AGI، در نگاه اول بسیار چشمگیر به نظر می‌رسد. بااین‌حال، این امتیاز به شرایط اجرای آزمون وابسته است و تنها عددی نیست که برای ارزیابی Astra باید در نظر گرفت.

نتایج عملکرد مدل GPT-6 Astra در جدول امتیازات آزمون ARC-AGI 3 که نشان‌دهنده نسبت امتیاز کسب شده به هزینه پردازش است.

در هارنس استاندارد و مستقل از ارائه‌دهنده (Provider-Neutral)، استرا با سطح استدلال Max امتیاز ۶۲٫۷ درصد گرفته است. در مقابل، امتیاز ۹۹٫۹ درصد مربوط به اجرای استرا با سطح استدلال High در هارنسی است که از Provider Adapter استفاده می‌کند.

روش ارزیابی

مدل و سطح استدلال

امتیاز

هارنس استاندارد و مستقل از ارائه‌دهنده

GPT-6 Astra Max

۶۲٫۷٪

هارنس مجهز به Provider Adapter

GPT-6 Astra High

۹۹٫۹٪

تفاوت این دو نتیجه به نحوه اجرای مدل برمی‌گردد. Provider Adapter امکان حفظ وضعیت استدلال و فرایند فشرده‌سازی (Compaction) میان درخواست‌ها را فراهم می‌کند؛ درحالی‌که هارنس استاندارد با هدف مقایسه مدل‌ها در شرایط یکسان و مستقل از سازنده طراحی شده است.

نمی‌توان ادعای OpenAI درباره «عصر AGI» را صرفاً با استناد به یک تأیید یا رد کرد

بنابراین، این دو امتیاز را نباید دو اندازه‌گیری کاملاً مشابه از توانایی استرا دانست. امتیاز ۹۹٫۹ درصدی نشان‌دهنده عملکرد مدل در شرایطی است که از Provider Adapter استفاده شده، درحالی‌که نتیجه ۶۲٫۷ درصد تصویر عملکرد استرا در محیط استانداردتر و قابل مقایسه‌تر را ارائه می‌دهد.

نتایج بررسی عملکرد مدل‌های مختلف Astra در بنچمارک‌های استاندارد و تطبیق‌یافته برای سنجش میزان نزدیک شدن به هوش مصنوعی عمومی (AGI).

این تفاوت یک نکته مهم درباره بنچمارک‌های مدل‌های پیشرفته را نشان می‌دهد: نتیجه فقط به خود مدل وابسته نیست؛ روش اجرای آزمون، ابزارهای در دسترس، حفظ وضعیت بین درخواست‌ها و نحوه مدیریت کانتکست هم می‌توانند روی امتیاز نهایی تأثیر بگذارند.

در نتیجه، نمی‌توان ادعای OpenAI درباره نزدیک‌شدن به «عصر AGI» را صرفاً با استناد به یک امتیاز ۹۹٫۹ درصدی تأیید یا رد کرد. ارزیابی استرا نیازمند کنار هم گذاشتن نتایج استاندارد، تجربه استفاده واقعی و محدودیت‌های روش‌های سنجش است.

Code Arena WebDev؛ آزمونی نزدیک‌تر به تجربه واقعی توسعه‌دهندگان

یکی از تفاوت‌های مهم ارزیابی‌های Arena با بنچمارک‌های سنتی این است که به‌جای اندازه‌گیری یک توانایی مشخص، کاربران واقعی خروجی مدل‌ها را با هم مقایسه می‌کنند.

استرا در Code Arena WebDev که مدل‌ها را در وظایف توسعه وب و گردش‌کارهای کدنویسی عامل‌محور با رأی کاربران رتبه‌بندی می‌کند، اهمیت ویژه‌ای دارد، چون یکی از مهم‌ترین وعده‌های اوپن‌ای‌آی درباره این مدل، توانایی در توسعه نرم‌افزار و انجام وظایف عامل‌محور است.

نتایج رتبه‌بندی مدل‌های زبانی بزرگ در حوزه توسعه وب بر اساس معیارهای Code Arena در سپتامبر ۲۰۲۶

در اسنپ‌شات ۵ سپتامبر ۲۰۲۶ کدآرنا، GPT-6 Astra Max با امتیاز ۱۷۹۷ در رتبه نخست قرار دارد، اما بازه‌ی امتیاز آن با فیبل ۵٫۱ هم‌پوشانی دارد و از نظر آماری قطعی نیست؛ زیرا بازه‌ی رتبه‌ای هر دو مدل (Rank Spread) بین رتبه‌ی ۱ تا ۲ قرار دارد. این یعنی با در نظر گرفتن عدم‌قطعیت امتیازها، هر دو مدل همچنان می‌توانند در جایگاه اول یا دوم قرار بگیرند.

بنابراین نمی‌توان نتیجه قطعی گرفت که استرا رقیب خود را شکست داده؛ بلکه می‌توان گفت که استرا در یکی از مهم‌ترین سناریوهای کاربردی خود، یعنی تولید خروجی‌های توسعه وب، در بالاترین سطح رقابت قرار دارد.

جدول Code Arena بر رأی و مقایسه خروجی‌ها در وظایف توسعه وب متکی است و جای آزمایش کنترل‌شده‌ی آزمایشگاهی را نمی‌گیرد؛ اما برای فهم عملکرد مدل در خروجی‌های واقعی‌تر توسعه وب، سیگنال مفیدی است.

استرا کجا می‌درخشد؟

اگر نتایج ارزیابی‌های مستقل را در کنار یکدیگر قرار دهیم، تصویری متعادل‌تر از جایگاه Astra به دست می‌آید:

  • در کارهای عامل‌محور، کدنویسی و استفاده از ابزارها: استرا عملکردی در سطح بهترین مدل‌های موجود دارد و در برخی ارزیابی‌ها به رتبه‌های برتر می‌رسد.
  • در سنجش هوش کلی: استرا در جمع قدرتمندترین مدل‌های حال حاضر قرار دارد، اما نتایج همه ارزیابی‌ها برتری مطلق آن را تأیید نمی‌کنند.
  • در آزمون‌هایی مانند ARC-AGI: استرا به نتایج بسیار چشمگیری می‌رسد، اما همان‌طور که دیدیم، تفسیر این نتایج به روش اجرای آزمون و شرایط ارزیابی وابسته است.
  • در ارزیابی‌های مبتنی بر ترجیح کاربران: استرا نشان می‌دهد خروجی‌های آن در تعاملات واقعی می‌تواند با بهترین مدل‌های رقیب رقابت کند.

در مجموع، ارزیابی‌های مستقل تصویری از مدلی ارائه می‌دهند که در طیف گسترده‌ای از وظایف عملکردی بسیار قدرتمند دارد، اما نمی‌توان جایگاه آن را با یک بنچمارک یا یک رتبه واحد خلاصه کرد.

نقطه قوت اصلی استرا، ترکیب استدلال، کدنویسی، ابزار و انجام وظایف چندمرحله‌ای برای حل مسائل واقعی است

نقطه قوت اصلی استرا در ترکیب توانایی استدلال، کدنویسی، استفاده از ابزار و انجام وظایف چندمرحله‌ای است؛ حوزه‌هایی که بیش از یک امتیاز بنچمارک، به توانایی مدل برای انجام کارهای واقعی نزدیک هستند.

در یک جمله، استرا قدرتمندترین مدل اوپن‌ای‌آی تا امروز است؛ اما اهمیت واقعی آن شاید نه در اینکه چند رقیب را شکست می‌دهد، بلکه در این باشد که چقدر ما را به هوش مصنوعی‌ای نزدیک می‌کند که بتواند کارهای واقعی را به‌جای ما انجام دهد.

تجربه کاربران از GPT-6 Astra چه می‌گوید؟

اعداد بنچمارک‌ها فقط بخشی از داستان GPT-6 استرا هستند. تجربه کاربران اولیه نشان می‌دهد مهم‌ترین تفاوت این مدل با نسل‌های قبل، بیشتر در توانایی انجام کارهای چندمرحله‌ای دیده می‌شود تا صرفاً بهتر جواب دادن.

بازخوردهای اولیه توسعه‌دهندگان و کاربران حرفه‌ای بیشتر روی کارهایی مانند تحلیل پروژه‌های بزرگ‌تر، اصلاح کد، دنبال کردن مسیرهای طولانی و استفاده از ابزارها بوده است. برای این دسته از کاربران، استرا کمتر شبیه یک چت‌بات و بیشتر شبیه یک دستیار اجرایی عمل می‌کند.

هزینه استفاده، سرعت پاسخ‌گویی و نیاز به بررسی خروجی‌ها همچنان از مهم‌ترین نگرانی‌ها هستند

بااین‌حال، تجربه واقعی کاربران یک تصویر کاملاً بی‌نقص ارائه نمی‌کند. هزینه استفاده، سرعت پاسخ‌گویی و نیاز به بررسی خروجی‌ها همچنان از مهم‌ترین نگرانی‌ها هستند. حتی زمانی که استرا بتواند بخش بزرگی از یک کار را انجام دهد، کاربران همچنان مجبورند تصمیم‌های مهم را بررسی و نتیجه نهایی را کنترل کنند.

یکی دیگر از بحث‌های مطرح‌شده در روزهای ابتدایی عرضه، تجربه نامنظم برخی کاربران از دسترسی و ظرفیت سرویس بود؛ مسئله‌ای که نشان داد عرضه یک مدل مرزی در مقیاس میلیون‌ها کاربر، به اندازه ساخت خود مدل چالش‌برانگیز است.

در مجموع، بازخوردهای اولیه بیشتر به این نتیجه مشترک می‌رسند که استرا جهشی مهم در مسیر دستیارهای هوشمند است، اما تجربه فعلی آن بیشتر شبیه یک «همکار دیجیتال بسیار قدرتمند» است تا هوش عمومی مستقل.

قیمت و روش دسترسی به GPT-6 Astra

GPT-6 Astra در دسته مدل‌های حرفه‌ای اوپن‌ای‌آی قرار می‌گیرد و قیمت آن نشان می‌دهد این مدل بیشتر برای کارهای پیچیده مانند توسعه نرم‌افزار، استفاده از ابزارها، پژوهش و گردش‌کارهای چندمرحله‌ای طراحی شده است.

قیمت استاندارد API این مدل به ازای هر یک میلیون توکن به شکل زیر است:

نوع مصرف

قیمت به‌ازای هر یک میلیون توکن

ورودی

۱۰ دلار

ورودی کش‌شده

۱ دلار

Cache write

۱۲٫۵۰ دلار

خروجی

۵۰ دلار

درخواست‌هایی که بیش از ۲۷۲ هزار توکن ورودی داشته باشند، با تعرفه متفاوت محاسبه می‌شوند؛ در این حالت هزینه توکن‌های ورودی و کش‌شده دو برابر و هزینه توکن‌های خروجی ۱٫۵ برابر نرخ معمول خواهد بود. این موضوع برای استرا اهمیت زیادی دارد، چون مدل از پنجره کانتکست ۱٫۰۵ میلیون توکنی پشتیبانی می‌کند، اما استفاده از بخش‌های بسیار طولانی این ظرفیت الزاماً با همان هزینه پایه انجام نمی‌شود.

اوپن‌ای‌آی برای پردازش‌هایی که نیاز به پاسخ فوری ندارند، حالت‌های Batch و Flex را با هزینه پایین‌تر ارائه می‌کند. در مقابل، حالت Fast برای کاهش زمان پاسخ طراحی شده و هزینه بیشتری دارد. البته Fast برای استرا در حالت EU data residency در دسترس نیست؛ محدودیتی که بیشتر برای مشتریان سازمانی با الزامات محل پردازش و نگهداری داده اهمیت دارد.

مقایسه قیمت Astra با GPT-5.6 Sol و Claude Fable 5.1

از نظر قیمت رسمی API، استرا نسبت به نسل قبلی خود مدل گران‌تری محسوب می‌شود. استفاده از استرا نسبت به Sol حدود ۲٫۵ برابر گران‌تر است؛ چه در هزینه ورودی و چه خروجی. در مقابل، قیمت پایه استرا تقریباً هم‌سطح کلاد فیبل ۵٫۱ قرار می‌گیرد.

مدل

ورودی

خروجی

GPT-6 Astra

۱۰ دلار

۵۰ دلار

GPT-5.6 Sol

۴ دلار

۲۰ دلار

Claude Fable 5.1

۱۰ دلار

۵۰ دلار

اما قیمت هر توکن تنها بخشی از هزینه واقعی است. در مدل‌های عامل‌محور، تعداد توکن‌های مصرفی، فراخوانی ابزارها و طول گردش‌کار هم روی هزینه نهایی اثر می‌گذارند. بنابراین برای انتخاب مدل، باید تعادل میان کیفیت خروجی، سرعت و هزینه نهایی انجام کار را هم‌زمان در نظر گرفت.

نحوه دسترسی به استرا

دسترسی به GPT-6 Astra بسته به نوع کاربر و روش استفاده متفاوت است. استرا از طریق اوپن‌ای‌آی API با شناسه‌ی gpt-6-astra در اختیار توسعه‌دهندگان قرار گرفته است و اوپن‌ای‌آی ارائه‌ی آن از طریق Microsoft Azure و AWS Bedrock را نیز اعلام کرده است. در API، این مدل برای سطح رایگان (Free tier) پشتیبانی نمی‌شود.

برای کاربران عادی، استرا از طریق ChatGPT ارائه می‌شود و دسترسی به آن به‌صورت تدریجی فعال می‌شود. کاربران پلن‌های پولی ChatGPT مانند Plus، Pro، Business و Enterprise می‌توانند بسته به نوع حساب، منطقه، ظرفیت سرویس و سیاست عرضه اوپن‌ای‌آی به این مدل دسترسی پیدا کنند.

در محیط‌های سازمانی نیز مدیران Workspace می‌توانند دسترسی کاربران به مدل را مدیریت کنند و محدودیت‌های استفاده به نوع پلن و سیاست‌های اوپن‌ای‌آی بستگی دارد.

آیا GPT-6 Astra به AGI نزدیک شده است؟

GPT-6 Astra با وجود توانایی‌های چشمگیر، هنوز فاصله‌ای میان «مدل بسیار قدرتمند» و «هوش عمومی مستقل» دارد. این مدل می‌تواند با کامپیوتر کار کند، ابزارها را به کار بگیرد، کد بنویسد و وظایف چندمرحله‌ای را انجام دهد؛ اما همین توانایی‌ها به معنی رسیدن به هوشی هم‌سطح انسان نیستند.

یکی از مهم‌ترین محدودیت‌های استرا، هزینه و پیچیدگی استفاده از آن است. این مدل برای رسیدن به کیفیت بالاتر معمولاً منابع بیشتری مصرف می‌کند و در برخی سنجش‌ها سرعت پایین‌تری نسبت به مدل‌های قبلی دارد؛ موضوعی که برای استفاده گسترده در محصولات و سرویس‌ها اهمیت زیادی پیدا می‌کند.

عکاس: مبین احمدی / زومیت

از طرف دیگر، افزایش توانایی‌های عامل‌محور استرا مانند کار با کامپیوتر، اجرای کد و تعامل با سیستم‌های واقعی، نیاز به کنترل و نظارت را بیشتر می‌کند. هرچه مدل اختیار بیشتری برای انجام کار داشته باشد، مدیریت دسترسی، بررسی خروجی‌ها و کنترل خطاها اهمیت بیشتری پیدا می‌کند.

اما آیا این یعنی استرا آغاز عصر AGI است؟ پاسخ به تعریف ما از AGI بستگی دارد.

استرا نشان می‌دهد که مسیر هوش مصنوعی از پاسخ دادن به سمت انجام دادن حرکت کرده است

اگر AGI را سیستمی بدانیم که می‌تواند طیف گسترده‌ای از کارهای دیجیتال را انجام دهد، استرا یکی از نزدیک‌ترین مدل‌های تجاری به این ایده است. نتایج بنچمارک‌ها، قابلیت استفاده از ابزارها و توانایی انجام وظایف پیچیده نشان می‌دهند مدل‌های زبانی وارد مرحله تازه‌ای شده‌اند.

بااین‌حال، اگر AGI را به معنای هوشی هم‌سطح انسان با درک عمومی، تصمیم‌گیری مستقل و عملکرد قابل اعتماد در شرایط ناشناخته بدانیم، داده‌های فعلی هنوز چنین نتیجه‌ای را ثابت نمی‌کنند.

شاید مهم‌ترین تغییر استرا این نباشد که آیا امروز AGI محسوب می‌شود یا نه؛ بلکه این است که نشان می‌دهد مسیر هوش مصنوعی از «پاسخ دادن» به سمت «انجام دادن» حرکت کرده است.

اگر به GPT-6 Astra دسترسی پیدا کرده‌اید، تجربه خودتان را درباره سرعت، دقت و توانایی انجام کارهای چندمرحله‌ای با ما و دیگر کاربران زومیت به اشتراک بگذارید. به نظر شما مهم‌ترین تغییر استرا چیست: هوش بالاتر، توانایی انجام کارها یا نزدیک‌تر شدن به AGI؟