آنتروپیک با معرفی کلاد فیبل ۵٫۱ در اول سپتامبر ۲۰۲۶، نسخه‌ای جدید از مدل پرچمدار خود را با تمرکز روی کدنویسی طولانی‌مدت، پژوهش چندمرحله‌ای و کارهای عامل‌محور عرضه کرد. فیبل ۵٫۱ همان مدل پایه‌ای است که پشت کلاد Mythos 5.1 قرار دارد؛ با این تفاوت که برای استفاده عمومی، لایه‌های ایمنی سخت‌گیرانه‌تری در حوزه‌های زیست‌شناسی و امنیت سایبری روی آن اعمال شده است.

مدل جدید با پنجره زمینه یک‌میلیون‌توکنی و حداکثر خروجی ۱۲۸ هزار توکن عرضه می‌شود و قیمت ورودی و خروجی آن نسبت به فیبل ۵ تغییری نکرده است؛ بااین‌حال، هزینه خواندن داده‌های کش‌شده ۷۵ درصد کاهش یافته است. تمرکز اصلی فیبل ۵٫۱ برخلاف چت‌بات‌های معمولی، پاسخ‌دادن به درخواست‌های کوتاه نیست. آنتروپیک می‌خواهد این مدل بتواند پروژه‌های چندمرحله‌ای را برای ساعت‌ها یا حتی چند روز دنبال کند، ابزارهای مختلف را به‌کار بگیرد، نتیجه‌ی کار خود را بررسی کند و در صورت شکست یک مرحله، مسیر دیگری را امتحان کند.

مدل فیبل ۵٫۱ مدت کوتاهی پس از انتشار، توانست به صدر جدول Code Arena: WebDev راه یابد و در پنج بخش از شش حوزه اصلی آن بیشترین امتیاز را به دست آورد. این دستاورد به همراه ارزیابی مستقل Artificial Analysis، دید شفاف‌تری از وضعیت این مدل در مقایسه با نسل پیشین و رقبای سرسخت آن فراهم می‌کند. در ادامه، عملکرد این مدل را دقیق‌تر بررسی می‌کنیم.

Fable 5.1 چیست و چرا مهم است؟

فیبل ۵٫۱ جدیدترین مدل آنتروپیک برای استدلال سنگین، کدنویسی عامل‌محور، کارهای دانش‌محور و وظایف طولانی‌مدت است. فیبل ۵٫۱ در اول سپتامبر ۲۰۲۶، هم‌زمان با کلاد Mythos 5.1 معرفی شد. هر دو مدل بر پایه یک مدل مشترک ساخته شده‌اند، اما میتوس ۵٫۱ هنوز برای عموم در دسترس نیست و دسترسی به آن به‌صورت محدود ارائه می‌شود.

Anthropic

فیبل ۵٫۱ برای کارهایی طراحی شده که ممکن است ساعت‌ها ادامه داشته باشند و مدل در آن‌ها باید میان چند مرحله، فایل، ابزار و تصمیم مختلف ارتباط برقرار کند. به بیان ساده، هدف فیبل ۵٫۱ این نیست که فقط پاسخ بهتری به یک پرامپت بدهد؛ بلکه قرار است بخش بزرگ‌تری از یک پروژه را به‌صورت مستقل جلو ببرد. برای مثال، در یک پروژه نرم‌افزاری می‌تواند کدبیس را بررسی کند، feature جدید اضافه کند، تست‌ها را اجرا کند، خطاها را بررسی کند و در ادامه کد را اصلاح کند.

فیبل ۵٫۱ همان مدل پایه میتوس ۵٫۱ است که تفاوتشان در تدابیر امنیتی است

فیبل ۵٫۱ نسخه‌ای است که آنتروپبک برای استفاده عمومی‌تر با تدابیر امنیتی دقیق‌تر عرضه کرده است. این موضوع توضیح می‌دهد چرا آنتروپیک می‌تواند توانایی‌های بسیار پیشرفته میتوس را در قالب فیبل برای کاربران عمومی‌تر ارائه کند

Fable 5.1 چه قابلیت‌هایی دارد؟

تمرکز اصلی فیبل ۵٫۱ را می‌توان در چهار حوزه کلیدی خلاصه کرد: کدنویسی در پروژه‌های بلندمدت، پژوهش عامل‌محور، کار با اسناد و فعالیت‌های دانشی و استفاده از ابزارها.

سازنده

آنتروپیک

تاریخ عرضه

۱ سپتامبر ۲۰۲۶

مدل پایه

نسل جدید Fable / همان مدل زیربنایی Mythos 5.1

پنجره کانتکست

۱ میلیون توکن

حداکثر خروجی

۱۲۸ هزار توکن

Thinking

استدلال تطبیقی (Adaptive)؛ همیشه فعال

ورودی

متن و تصویر

خروجی

متن

دانش قابل اتکا تا

ژوئن ۲۰۲۶

سرعت نسبی

کندتر از Opus 5

قیمت ورودی

۱۰ دلار / یک میلیون توکن

قیمت خروجی

۵۰ دلار / یک میلیون توکن

Cache read (خواندن از کش)

۰٫۲۵ دلار / یک میلیون توکن

Cache write (نوشتن در کش) پنج‌دقیقه‌ای

۱۲٫۵ دلار / یک میلیون توکن

Cache write یک‌ساعته

۲۰ دلار / یک میلیون توکن

وضعیت

فعال

فیبل ۵٫۱ برای کدنویسی عامل‌محور طراحی شده و می‌تواند وظایف پیچیده نرم‌افزاری را از ابتدا تا انتها دنبال کند؛ از کار روی کدبیس‌های بزرگ و افزودن قابلیت‌های جدید تا بازبینی و بهینه‌سازی کد. این مدل همچنین در مقایسه با نسل قبل، در تشخیص بن‌بست و گزارش‌کردن مشکلات عملکرد بهتری دارد.

این مدل علاوه بر برنامه‌نویسی، برای پژوهش چندمرحله‌ای و کار با اسناد، صفحه‌های گسترده و ارائه‌ها نیز بهینه شده است و می‌تواند اطلاعات را از منابع مختلف جمع‌آوری، مقایسه و در قالب یک خروجی منسجم ارائه کند.

فیبل ۵٫۱ از استدلال تطبیقی بهره می‌برد و کاربران می‌توانند میزان تلاش مدل برای استدلال را متناسب با پیچیدگی کار تنظیم کنند. این قابلیت به ایجاد تعادل میان کیفیت پاسخ و مصرف توکن کمک می‌کند.

این مدل مانند فیبل ۵ از پنجره متنی یک‌میلیون‌توکنی پشتیبانی می‌کند؛ ظرفیتی که امکان کار با اسناد طولانی، کدبیس‌های بزرگ و فرایندهای چندمرحله‌ای را فراهم می‌کند، اما در فیبل ۵٫۱ استفاده از این ظرفیت بهینه‌تر شده است.

Mythos 5.1 چه تفاوتی با Fable 5.1 دارد؟

فیبل ۵٫۱ و میتوس ۵٫۱ از یک مدل پایه استفاده می‌کنند، اما در سطح دسترسی و محدودیت‌های ایمنی تفاوت دارند. فیبل ۵٫۱ برای استفاده عمومی عرضه شده است، درحالی‌که میتوس ۵٫۱ در حال حاضر تنها از طریق دو برنامه دسترسی ویژه در اختیار سازمان‌های تأییدشده آمریکایی قرار می‌گیرد.

فیبل ۵٫۱ و میتوس ۵٫۱ در سطح دسترسی و محدودیت‌های ایمنی تفاوت دارند

در حوزه علوم زیستی، آنتروپیک اعلام کرده نخستین شرکت‌کنندگان را با همکاری دولت آمریکا ثبت‌نام کرده و قصد دارد به‌زودی ثبت‌نام را برای جامعه گسترده‌تر پژوهشگران باز کند.

در حوزه امنیت سایبری نیز دسترسی به مدل‌های رده میتوس هنوز فعال نشده و برنامه تأیید امنیت سایبری (CVP) فعلاً مدل‌های رده اوپوس را پوشش می‌دهد؛ آنتروپیک اعلام کرده که قصد دارد در آینده نزدیک دسترسی به رده میتوس را نیز به این برنامه اضافه کند.

ویژگی

فیبل ۵٫۱

میتوس ۵٫۱

مدل پایه

یکسان

یکسان

پنجرهٔ متنی

۱ میلیون توکن

۱ میلیون توکن

حداکثر خروجی

۱۲۸ هزار توکن

۱۲۸ هزار توکن

قیمت API

۱۰ / ۵۰ دلار

۱۰ / ۵۰ دلار

دسترسی

عمومی

محدود

محدودیت‌های امنیت سایبری

فعال

دسترسی ویژه از مسیر Cyber Verification در آینده نزدیک اعلام

محدودیت‌های علوم زیستی

فعال

دسترسی محدود و دعوت‌محور برای سازمان‌های تأییدشده

هدف اصلی

کدنویسی و کارهای دانشی

پژوهش در امنیت سایبری و علوم زیستی

تفاوت اصلی این دو مدل در سطح دسترسی و سازوکارهای ایمنی است، نه ظرفیت پردازشی پایه. فیبل ۵٫۱ با محدودیت‌های ایمنی بیشتر برای استفاده عمومی ارائه شده است.

میتوس ۵٫۱ در حال حاضر فقط از طریق دو برنامه دسترسی ویژه در اختیار سازمان‌های تأییدشده آمریکایی قرار می‌گیرد

برای مثال، فیبل ۵٫۱ می‌تواند آسیب‌پذیری‌های نرم‌افزاری را در کد شناسایی کند، اما برخی فعالیت‌های پرخطر مانند تولید اکسپلویت و نفوذ آزمایشی همچنان محدود هستند. میتوس ۵٫۱ در واقع نسخه‌ای با دسترسی کنترل‌شده و محدودیت‌های ایمنی متفاوت از همان مدل پایه است.

Fable 5.1 در مقایسه با Fable 5 چقدر بهتر شده است؟

اگر مشخصات فنی دو مدل را کنار هم بگذاریم، تفاوت چندان بزرگ نیست؛ هر دو یک‌میلیون توکن کانتکست و ۱۲۸ هزار توکن خروجی دارند و قیمت عادی ورودی و خروجی نیز یکسان است. جهش اصلی فیبل ۵٫۱ در توانایی مدل برای انجام وظایف پیچیده و همچنین هزینه cache read اتفاق افتاده است.

مقایسه مشخصات Fable 5.1 و Fable 5

ویژگی

Fable 5.1

Fable 5

تغییر

کانتکست

۱ میلیون

۱ میلیون

بدون تغییر

حداکثر خروجی

۱۲۸ هزار

۱۲۸ هزار

بدون تغییر

قیمت input

۱۰ دلار

۱۰ دلار

بدون تغییر

قیمت output

۵۰ دلار

۵۰ دلار

بدون تغییر

Cache read

۰٫۲۵ دلار

۱ دلار

۷۵٪ ارزان‌تر

Thinking

Adaptive

Adaptive

بهبود در رفتار و کنترل effort

تمرکز

عامل‌های خودمختار برای وظایف طولانی‌مدت، کدنویسی و پژوهش

کدنویسی و کارهای عامل‌محور

تمرکز عمیق‌تر روی وظایف طولانی

تاریخ عرضه

سپتامبر ۲۰۲۶

ژوئن ۲۰۲۶

آنتروپیک می‌گوید کاهش هزینه خواندن از کش می‌تواند هزینه اجرای بارهای کاری معمولی را حدود ۲۵ درصد و بارهای کاری بسیار عامل‌محور را تا حدود ۴۵ درصد کاهش دهد. البته این ارقام برآورد خود آنتروپیک هستند و نباید آن‌ها را به‌عنوان کاهش قطعی هزینه برای همه وظایف در نظر گرفت.

بنچمارک‌های رسمی آنتروپیک درباره‌ فیبل ۵٫۱ چه می‌گویند؟

برای بررسی عملکرد فیبل ۵٫۱، آنتروپیک مجموعه‌ای از آزمون‌های مربوط به کدنویسی، استدلال، کار با کامپیوتر و کارهای دانشی را منتشر کرده است.

بنچمارک

چه چیزی را می‌سنجد؟

Fable 5.1

Fable 5

Opus 5

GPT-5.6 Sol

Terminal-Bench-Science 0.1

پژوهش علمی عامل‌محور در ترمینال

۵۲٫۶٪

۲۴٫۷٪

۲۹٫۰٪

۲۲٫۴٪

Terminal-Bench 4.0

کدنویسی و حل مسئله چندمرحله‌ای در ترمینال

۵۵٫۸٪

۴۲٫۰٪

۵۲٫۳٪

۳۷٫۳٪

GDPval-AA v2

وظایف حرفه‌ای و دانش‌محور

۱۸۵۳ Elo

۱۷۲۳

۱۸۲۴

۱۷۱۱

OSWorld 2.0 — partial

انجام وظایف روی محیط کامپیوتری

۷۷٫۹٪

۷۲٫۹٪

۷۵٫۴٪

OSWorld 2.0 — strict

اجرای دقیق‌تر وظایف کامپیوتری

۴۱٫۷٪

۳۶٫۱٪

۳۹٫۶٪

Humanity’s Last Exam

دانش و استدلال در مسائل بسیار دشوار

۶۰٫۹٪

۵۷٫۸٪

۵۶٫۶٪

Humanity’s Last Exam + tools

HLE همراه با ابزار

۶۵٫۰٪

۶۳٫۸٪

۶۳٫۶٪

AutomationBench

اجرای ورکفلوهای عامل‌محور

۳۱٫۴٪

۱۷٫۱٪

۲۶٫۹٪

۱۹٫۶٪

CursorBench 3.2.0

کدنویسی در ورک‌فلو محیط IDE

۷۳٫۴٪

۷۰٫۵٪

۷۰٫۰٪

۶۷٫۲٪

این نتایج مربوط به ارزیابی‌های خود آنتروپیک هستند و بعضی از آزمون‌ها نیز تحت شرایط مشخصی انجام شده‌اند. برای مثال، در آزمون Terminal-Bench-Science، خطای استاندارد نتایج مدل‌ها حدود ۳٫۵ تا ۴٫۵ واحد است؛ بنابراین، اختلاف‌های کوچک بین امتیازها لزوماً معنادار نیستند. همچنین، امتیازهای OSWorld بر اساس مجموعه وظایفی هستند که در آگوست ۲۰۲۶ منتشر شده‌اند و به همین دلیل، مقایسه مستقیم آن‌ها با نتایج نسخه‌های قبلی این آزمون درست نیست.

بزرگ‌ترین جهش فیبل ۵٫۱ کجاست؟

یکی از چشمگیرترین نتایج در Terminal-Bench-Science، که توانایی مدل در انجام پژوهش علمی عامل‌محور در محیط ترمینال را می‌سنجد، به دست آمده است. امتیاز فیبل ۵٫۱ در این آزمون از ۲۴٫۷ درصد در فیبل ۵ به ۵۲٫۶ درصد رسیده؛ یعنی ۲۷٫۹ واحد درصد افزایش.

Anthropic

در Terminal-Bench 4.0 نیز که کدنویسی و حل مسائل چندمرحله‌ای در محیط ترمینال را ارزیابی می‌کند، امتیاز مدل از ۴۲ درصد به ۵۵٫۸ درصد افزایش یافته است.

Anthropic

در مقابل، میزان بهبود در آزمون‌های دیگر محدودتر بوده است. در HLE بدون ابزار، که توانایی مدل در پاسخ‌گویی به پرسش‌های دشوار در حوزه‌های مختلف را بدون دسترسی به ابزارها می‌سنجد، امتیاز از ۵۷٫۸ به ۶۰٫۹ درصد رسیده است.

Anthropic

نمودار رسمی آنتروپیک برای این آزمون در سطوح مختلف تلاش (از low تا max) نیز همین روند را نشان می‌دهد؛ در هر سطح هزینه‌ی مشخص، فیبل ۵٫۱ نسبت به فیبل ۵ دقت بالاتری ثبت کرده است. برای نمونه، فیبل ۵٫۱ در حالت استفاده از ابزار و حداکثر تلاش به ۶۵ درصد می‌رسد، درحالی‌که فیبل ۵ برای رسیدن به ۶۳٫۸ درصد باید هزینه‌ی بیشتری صرف کند.

پیشرفت فیبل ۵٫۱ در وظایفی دیده می‌شود که نیازمند اجرای چندمرحله‌ای و استفاده از ابزار هستند

در CursorBench نیز که عملکرد مدل را در انجام وظایف واقعی کدنویسی در محیط ویرایشگر Cursor ارزیابی می‌کند، امتیاز از ۷۰٫۵ به ۷۳٫۴ درصد افزایش یافته است.

Anthropic

بنابراین به‌نظر می‌رسد بیشترین پیشرفت فیبل ۵٫۱ در وظایفی دیده می‌شود که نیازمند اجرای چندمرحله‌ای و استفاده از ابزار هستند، نه صرفاً پاسخ‌دادن به یک پرسش منفرد.

بنچمارک‌های مستقل درباره فیبل ۵٫۱ چه می‌گویند؟

در ادامه، برای درک بهتر عملکرد فیبل ۵٫۱ فراتر از آنچه آنتروپیک می‌گوید، بهتر است نتایج ارزیابی‌های مستقل را مرور کنیم. این ارزیابی‌ها از آن جهت اهمیت دارند که شرایط آزمون در آن‌ها مستقل از جدول رسمی آنتروپیک است.

ارزیابی‌های Artificial Analysis از فیبل ۵٫۱

در کنار نتایج آنتروپیک، Artificial Analysis نیز پیش از عرضه عمومی، Fable 5.1 را ارزیابی کرده است. این مجموعه در شاخص هوش خود، فیبل ۵٫۱ را در حالت Max با امتیاز ۶۶ در رتبه نخست قرار داده است.

رتبه‌بندی مدل‌های زبانی بزرگ از جمله Claude 5.1 و GPT-5 بر اساس ارزیابی‌های شاخص تحلیل هوش مصنوعی.

فیبل ۵٫۱ در این شاخص چهار امتیاز بیشتر از فیبل ۵ کسب کرده و به بالاترین امتیازی رسیده است که Artificial Analysis یا همان AA تا زمان انجام این ارزیابی ثبت کرده بود.

این ارزیابی با سازوکار فالبک (fallback) پیش‌فرض آنتروپیک انجام شده است؛ یعنی اگر سامانه‌های حفاظتی Anthropic یک درخواست را مشکوک یا نامناسب تشخیص می‌دادند، آن درخواست ممکن بود به‌جای فیبل ۵٫۱ به اپوس ۴٫۸ یا اپوس ۵ منتقل شود. در مجموع، حدود ۴ درصد از توکن‌های خروجی این ارزیابی از این مدل‌های جایگزین تولید شده‌اند. بنابراین، امتیاز ۶۶ را باید به‌عنوان نتیجه فیبل ۵٫۱ در این شرایط ارزیابی در نظر گرفت، نه یک سنجش کاملاً مجزا از عملکرد خود مدل؛ بااین‌حال، از این داده به‌تنهایی نمی‌توان میزان تأثیر fallback بر امتیاز نهایی را تعیین کرد.

بنچمارک مستقل

چه چیزی را می‌سنجد؟

Fable 5.1

Fable 5

نکته

HLE

دانش و استدلال در مسائل بسیار دشوار و چندرشته‌ای

۵۹٫۱٪

۵۵٫۵٪

Fable 5.1 حدود ۳٫۶ واحد درصد بهتر است و بالاترین نتیجه ثبت‌شده AA در زمان ارزیابی را کسب کرده است.

Terminal-Bench v2.1

توانایی مدل در اجرای وظایف پیچیده کدنویسی و حل مسئله در محیط ترمینال

۹۱٫۴٪

حدود ۸۵٪

Fable 5.1 بالاترین امتیاز اندازه‌گیری‌شده را ثبت کرده است. امتیاز ۸۵٪ مربوط به snapshot ارزیابی AA در ۳۰ جولای ۲۰۲۶ است.

SciCode

توانایی حل مسائل علمی و تولید یا اصلاح کدهای مرتبط با پژوهش‌های علمی

۶۲٫۰٪

۶۰٫۲٪

Fable 5.1 با اختلاف ۱٫۸ واحد درصد بالاتر است و در زمان ارزیابی رتبه نخست را داشته است.

GDPval-AA v2

عملکرد مدل در انجام وظایف حرفه‌ای و دانش‌محور در مشاغل مختلف

۱۸۵۳ Elo

۱۷۲۳ Elo

Fable 5.1 حدود ۱۳۰ Elo بالاتر از Fable 5 قرار گرفته است.

AA-Briefcase

توانایی انجام مجموعه‌ای از وظایف واقعی اداری، تحلیلی و حرفه‌ای، ازجمله تحلیل و ارائه اطلاعات

۱۶۹۴ Elo

۱۵۷۲ Elo

Fable 5.1 حدود ۱۲۲ Elo بالاتر از Fable 5 است؛ هرچند اختلاف آن با Opus 5 بسیار کوچک است.

AA-Omniscience accuracy

درصد پاسخ‌های درست (Raw Accuracy) در ارزیابی AA-Omniscience؛ این شاخص به‌تنهایی معیار «تشخیص میزان اطمینان» یا «پرهیز از hallucination» نیست

۶۷٫۲٪

۶۵٫۴٪

دقت خام Fable 5.1 حدود ۱٫۸ واحد درصد بیشتر است؛ بااین‌حال، به‌دلیل نرخ تلاش و حدس بیشتر، امتیاز کلی AA-Omniscience دو مدل تقریباً برابر باقی مانده است.

در آزمون HLE، مدل فیبل ۵٫۱ توانسته به ۵۹٫۱ درصد پاسخ درست برسد و عملکرد بهتری از فیبل ۵ داشته باشد. همچنین در آزمون Terminal-Bench v2.1 که توانایی مدل در انجام وظایف کدنویسی و کار با ترمینال را می‌سنجد، امتیاز ۹۱٫۴ درصد گرفته است. در آزمون SciCode نیز که برای ارزیابی توانایی مدل در حل مسائل علمی و نوشتن کدهای مرتبط طراحی شده، امتیاز ۶۲ درصد به‌دست آورده است.

فیبل ۵٫۱ در انجام کارهایی مانند تحلیل، نگارش حرفه‌ای، پردازش اطلاعات و حل مسائل پیچیده عملکرد بسیار قدرتمندی دارد

در GDPval-AA v2، مدل‌ها با استفاده از سیستم امتیازدهی Elo با یکدیگر مقایسه می‌شوند؛ روشی مشابه رتبه‌بندی بازیکنان شطرنج که در آن مدل‌ها پاسخ‌های یکدیگر را در مجموعه‌ای از وظایف حرفه‌ای و دانش‌محور مقایسه می‌کنند.

در این ارزیابی مستقل، فیبل ۵٫۱ Max امتیاز ۱۸۵۳ Elo به‌دست آورد و بالاتر از اپوس ۵ Max با امتیاز ۱۸۲۴ و فیبل ۵ Max با ۱۷۲۳ قرار گرفت.

نتایج ارزیابی عملکرد مدل‌های زبانی بزرگ در بنچمارک‌های تخصصی هوش مصنوعی برای سنجش توانایی‌های تحلیل و حل مسئله.

مدل

GDPval-AA v2

Fable 5.1 Max

۱۸۵۳ Elo

Opus 5 Max

۱۸۲۴ Elo

Fable 5 Max

۱۷۲۳ Elo

این نتیجه نشان می‌دهد فیبل ۵٫۱ در انجام کارهایی مانند تحلیل، نگارش حرفه‌ای، پردازش اطلاعات و حل مسائل پیچیده عملکرد بسیار قدرتمندی دارد؛ بااین‌حال، اختلاف آن با اپوس ۵ چندان زیاد نیست و به‌تنهایی نمی‌تواند برتری قطعی فیبل ۵٫۱ را ثابت کند.

بااین‌حال، اختلاف ۲۹ امتیازی فیبل ۵٫۱ و اپوس ۵ از نظر آماری قطعی نیست و فاصله اطمینان دو مدل هم‌پوشانی دارد. بنابراین بهتر است بگوییم فیبل ۵٫۱ در این ارزیابی بالاتر قرار گرفته، نه اینکه با قطعیت اپوس ۵ را شکست داده است.

در AA-Briefcase که عملکرد مدل‌ها را در وظایف ترکیبی دانش‌محور و حرفه‌ای نشان می‌دهد، عملکرد دو مدل بسیار نزدیک به هم است.

مدل

AA-Briefcase

کیفیت تحلیلی

ارائه

Fable 5.1

۱۶۹۴

۲۰۲۵

۱۴۹۵

Opus 5

۱۶۸۵

۱۹۸۰

۱۵۷۲

فیبل ۵٫۱ امتیاز بالاتری گرفته است؛ یعنی درک مسئله، بررسی جزئیات، دنبال‌کردن ارتباط میان اطلاعات و رسیدن به نتیجه منطقی عملکرد بهتری داشته است. در مقابل، اپوس ۵ در بخش ارائه امتیاز بیشتری کسب کرده؛ یعنی پاسخ‌هایش معمولاً ساختار منظم‌تر، توضیح روان‌تر و خروجی نهایی خواناتری داشته‌اند.

به زبان ساده، فیبل ۵٫۱ ممکن است تحلیل عمیق‌تر و دقیق‌تری ارائه دهد، اما اپوس ۵ می‌تواند همان نتیجه را مرتب‌تر و قابل‌فهم‌تر به کاربر تحویل دهد. به همین دلیل، با اینکه فیبل ۵٫۱ در امتیاز تحلیلی جلوتر است، اختلاف امتیاز کلی دو مدل زیاد نیست و نمی‌توان گفت در همه جنبه‌ها برتری محسوسی نسبت به اپوس ۵ دارد.

ارزیابی‌های Code Arena از فیبل ۵٫۱

یکی از مهم‌ترین نتایج پس از عرضه فیبل ۵٫۱، عملکرد آن در Code Arena: WebDev است؛ رتبه‌بندی‌ای که مدل‌ها را در وظایف توسعه وب و جریان‌های کاری عامل‌محور، با رأی کاربران ارزیابی می‌کند. در اسنپ‌شات عمومی قابل‌تأیید Code Arena در ۲ سپتامبر ۲۰۲۶، Fable 5.1 Max با امتیاز ۱۷۶۵ و ۱٬۱۰۶ رأی برای خود مدل در رتبه نخست قرار داشت؛ مجموع رأی‌های Arena در آن اسنپ‌شات ۶۴۰٬۸۰۶ بود.

رتبه

مدل

امتیاز

قیمت API

🥇 ۱

Fable 5.1 Max

۱۷۶۵

۱۰ / ۵۰ دلار

🥈 ۲

Qwen3.8-Max-0902

۱۶۸۹

۲ / ۶ دلار

🥉 ۳

Opus 5 Max

۱۶۸۷

۵ / ۲۵ دلار

۴

Kimi K3 Max

۱۶۷۴

۳ / ۱۵ دلار

۵

Qwen3.8-Max

۱۶۷۰

۲ / ۶ دلار

۶

Opus 5 High

۱۶۶۲

۵ / ۲۵ دلار

۷

Fable 5

۱۶۲۹

۱۰ / ۵۰ دلار

۸

Grok 4.6 High

۱۶۲۵

۲ / ۶ دلار

۹

Qwen3.8-Flash-Next

۱۶۲۵

۰٫۱۶ / ۰٫۴۷ دلار

۱۰

Hy4 Preview

۱۶۲۳

۰٫۸۳ / ۲٫۵۰ دلار

۱۲

GLM 5.3 Max

۱۶۱۱

۱٫۴۰ / ۴٫۴۰ دلار

۱۶

Gemini 3.7 Flash High

۱۵۸۷

۰٫۷۵ / ۳٫۷۵ دلار

۱۸

DeepSeek V4 Pro High

۱۵۸۲

۱٫۳۲ / ۳٫۹۶ دلار

در اسنپ‌شات عمومی دوم سپتامبر، فیبل ۵٫۱ مکس ۷۷ امتیاز بالاتر از Qwen3.8-Max-0902 با امتیاز ۱۶۸۸ و ۷۸ امتیاز بالاتر از اپوس ۵ مکس با امتیاز ۱۶۸۷ قرار داشت. فاصله آن با فیبل ۵ برابر با ۱۳۷ امتیاز بود.

ارقام جدول نسبت به زمان انتشاردر ۲ سپتامبر کمی تغییر کرده‌اند. هنگام عرضه، فیبل ۵٫۱ مکس با ۱۷۶۵ امتیاز صدرنشین بود؛ اکنون امتیاز آن به ۱۷۶۳ رسیده، درحالی‌که فیبل ۵ نیز از ۱۶۲۸ به ۱۶۲۹ رسیده است. بنابراین برتری فیبل ۵٫۱ مکس نسبت به نسل قبل همچنان پابرجاست، اما اختلاف فعلی ۱۳۴ امتیاز است.

حوزه

Fable 5.1 Max

Fable 5 Max

رشد

عملکرد کلی

۱۷۶۵

۱۶۲۸

+۱۳۷

Gaming (بازی)

۱۹۳۴

۱۷۰۰

+۲۳۴

Simulations (شبیه‌سازی)

۱۸۶۹

۱۶۷۳

+۱۹۶

Reference-Based Design (طراحی مبتنی بر مرجع)

۱۸۱۳

۱۶۵۳

+۱۶۰

Brand & Marketing (برند و بازاریابی)

۱۷۵۷

۱۶۲۵

+۱۳۲

Consumer Product (محصولات مصرفی)

۱۶۵۳

۱۵۶۵

+۸۸

Data & Analytics (داده و تحلیل)

۱۵۷۰

۱۵۵۳

+۱۷

بر اساس داده‌های Arena در زمان انتشار، فیبل ۵٫۱ مکس در هر شش حوزه نسبت به فیبل ۵ مکس امتیاز بالاتری کسب کرد؛ بیشترین رشد به حوزه‌های گیمینگ و شبیه‌سازی اختصاص داشت. این مدل در پنج حوزه از شش حوزه در رتبه نخست قرار گرفت اما در بخش داده و تحلیل به رتبه اول نرسید.

این نتایج را می‌توان نشانه‌ای مستقل از بهبود عملکرد فیبل ۵٫۱ نسبت به نسل قبل، به‌ویژه در کارهای عامل‌محور و توسعه وب، دانست؛ بااین‌حال، نباید آن‌ها را با نتایج یک آزمون آزمایشگاهی کنترل‌شده یکی دانست. همچنین، فیبل ۵٫۱ در زمان انتشار رأی‌های بسیار کمتری نسبت به برخی مدل‌های قدیمی‌تر داشت و تعدادی از مدل‌های رقیب، از جمله Qwen3.8-Max-0902، در Arena با برچسب «آزمایشی» نمایش داده می‌شدند.

قیمت Fable 5.1 چقدر است؟

قیمت پایه Fable 5.1 نسبت به Fable 5 تغییر نکرده است، اما هزینهٔ خواندن داده‌های کش‌شده (Cache Read) به‌طور چشمگیری کاهش یافته است. قیمت ورودی و خروجی این مدل به‌ترتیب ۱۰ و ۵۰ دلار به‌ازای هر یک میلیون توکن است؛ درحالی‌که هزینه خواندن داده‌های کش‌شده از ۱ دلار در فیبل ۵ به ۰٫۲۵ دلار در فیبل ۵٫۱ رسیده است.

قیمت پایه Fable 5.1 نسبت به Fable 5 تغییر نکرده است، اما هزینه خواندن داده‌های کش‌شده (Cache Read) به‌طور چشمگیری کاهش یافته است. قیمت ورودی و خروجی این مدل به‌ترتیب ۱۰ و ۵۰ دلار به‌ازای هر یک میلیون توکن است؛ درحالی‌که هزینه خواندن داده‌های کش‌شده از ۱ دلار در فیبل ۵ به ۰٫۲۵ دلار در فیبل ۵٫۱ رسیده است.

Anthropic

آنتروپیک می‌گوید این کاهش می‌تواند هزینه بارهای کاری معمول را حدود ۲۵ درصد و بارهای کاری بسیار عامل‌محور را تا حدود ۴۵ درصد کاهش دهد.

مدل

Input / ۱M

Output / ۱M

Cache Read / ۱M

پنجره متنی

Fable 5.1

۱۰ دلار

۵۰ دلار

۰٫۲۵ دلار

۱M

Fable 5

۱۰ دلار

۵۰ دلار

۱ دلار

۱M

Opus 5

۵ دلار

۲۵ دلار

۰٫۵۰ دلار

۱M

Sonnet 5

۲ دلار

۱۰ دلار

۰٫۲۰ دلار

۱M

در نتیجه، فیبل ۵٫۱ برای هر یک میلیون توکن ورودی و خروجی، دو برابر Opus 5 و پنج برابر Sonnet 5 قیمت دارد؛ در مقابل، هزینه خواندن داده‌های کش‌شده در آن یک‌چهارم فیبل ۵ است. بااین‌حال، هزینه واقعی استفاده فقط از روی نرخ API مشخص نمی‌شود و به میزان توکن مصرفی در هر کار نیز بستگی دارد.

تحلیل هزینه در برابر کارایی مدل‌های هوش مصنوعی آنتروپیک (Anthropic) و OpenAI در مقایسه با شاخص تحلیل مصنوعی.

ارزیابی Artificial Analysis نشان می‌دهد فیبل ۵٫۱ مکس با وجود کاهش ۷۵ درصدی هزینه Cache Read، در آزمون Intelligence Index حدود ۳٫۷۶ دلار به‌ازای هر کار هزینه دارد؛ این رقم برای فیبل ۵ مکس حدود ۳٫۱۴ دلار است.

مدل / حالت

Intelligence Index

هزینه تقریبی هر کار

Fable 5.1 Max

۶۶

۳٫۷۶ دلار

Fable 5 Max

۶۲

۳٫۱۴ دلار

Opus 5 Max

۶۳

۲٫۳۴ دلار

Fable 5.1 xhigh

۶۵

۲٫۷۲ دلار

AA دلیل اصلی این اختلاف را مصرف حدود ۱٫۷ برابر توکن خروجی در فیبل ۵٫۱ می‌داند. کاهش هزینه Cache Read حدود ۱٫۴ دلار از هزینه هر کار کم کرده، اما مصرف بیشتر توکن خروجی باعث شده هزینه نهایی فیبل ۵٫۱ مکس همچنان حدود ۲۰ درصد بیشتر از فیبل ۵ مکس (۳٫۷۶ در برابر ۳٫۱۴ دلار) باشد.

این الگو در بنچمارک‌های دیگر هم دیده می‌شود؛ برای نمونه در Terminal-Bench v2.1 و در سطح High effort، فیبل ۵٫۱ برای هر کار نزدیک به ۱۵ هزار توکن (شامل پاسخ و استدلال) تولید می‌کند.

تحلیل عملکرد مدل Claude Fable 5.1 در بنچمارک Terminal-Bench نسبت به سایر مدل‌های پیشرفته هوش مصنوعی.

اگر فقط قیمت API را ببینیم، فیبل ۵٫۱ همان قیمت فیبل ۵ را دارد؛ اما اگر هزینه انجام یک کار کامل را در نظر بگیریم، هزینه ممکن است گران‌تر تمام شود؛ زیرا مدل در برخی بارهای کاری توکن خروجی بسیار بیشتری تولید می‌کند.

اگر فقط قیمت API را ببینیم، فیبل ۵٫۱ همان قیمت فیبل ۵ را دارد

همین موضوع باعث شده Fable 5.1 Max با وجود تخفیف قابل‌توجه در Cache Read، بر اساس ارقام زنده فعلی حدود ۲۰ درصد گران‌تر از Fable 5 Max تمام شود. این مسئله برای ایجنت‌ها اهمیت بیشتری دارد؛ زیرا یک ایجنت ممکن است در جریان یک کار طولانی، بارها اطلاعات قبلی را از کش بخواند و در عین حال حجم زیادی توکن خروجی تولید کند.

در نتیجه، Fable 5.1 را نمی‌توان صرفاً یک مدل کم‌هزینه‌تر از Fable 5 دانست. مزیت اقتصادی آن بیشتر به نوع استفاده بستگی دارد: هرچه یک بار کاری بیشتر به خواندن مکرر اطلاعات کش‌شده متکی باشد، کاهش هزینه Cache Read اهمیت بیشتری پیدا می‌کند؛ در مقابل، کارهایی که به تولید خروجی بسیار طولانی نیاز دارند، ممکن است همچنان هزینه بالاتری داشته باشند.

نحوه دسترسی به فیبل ۵٫۱

فیبل ۵٫۱ برای کاربران و سازمان‌ها از طریق Claude در دسترس است و توسعه‌دهندگان نیز می‌توانند از طریق Claude API به آن دسترسی داشته باشند. این مدل همچنین در بسترهای ابری Amazon Web Services، Google Cloud و Microsoft Foundry ارائه شده و در گیت‌هاب کوپلت نیز به‌عنوان یک مدل عمومی و پایدار در دسترس است.

روش دسترسی

وضعیت

Claude

Claude API

Claude Code

GitHub Copilot

Amazon Web Services

Google Cloud

Microsoft Foundry

فیبل ۵٫۱ در پلن‌های پرو، مکس، تیم و سازمانی در دسترس است؛ اما نحوه محاسبه مصرف آن بسته به نوع پلن و صندلی متفاوت است. در پلن مکس، استفاده از فیبل ۵٫۱ از سهمیه عادی پلن کسر می‌شود. در مقابل، کاربران پرو و صندلی‌های استاندارد در پلن‌های تیم و سازمانی برای استفاده از این مدل باید از اعتبار مصرف استفاده کنند و مصرف فیبل ۵٫۱ از سهمیه عادی آن‌ها کسر نمی‌شود.

تجربه کاربران از فیبل ۵٫۱ چگونه است؟

هنوز برای قضاوت قطعی درباره تجربه کاربران زود است؛ چون مدل تنها در اول سپتامبر عرضه شده، اما در روزهای نخست چند الگوی مشخص در ردیت و انجمن‌های مرتبط دیده می‌شود.

عملکرد در کدبیس‌های بزرگ: برخی کاربران از توانایی فیبل ۵٫۱ در دنبال‌کردن زنجیره فراخوانی میان ده‌ها فایل و کار با اسناد طولانی رضایت داشته‌اند. همچنین گزارش‌هایی از توانایی مدل در تشخیص تغییرات کدنویسی مشکل‌زا و مخالفت با آن‌ها منتشر شده است.

خوانایی پاسخ‌ها: شماری از کاربران پاسخ‌های مدل را منسجم‌تر و خواناتر از فیبل ۵ و اپوس ۵ توصیف کرده‌اند؛ هرچند خوانایی بیشتر لزوماً به معنای دقت بالاتر نیست.

مصرف سریع سهمیه: یکی از انتقادهای پرتکرار، مصرف سریع‌تر سهمیه در نشست‌های طولانی است. برخی کاربران گفته‌اند مدل با چند درخواست سنگین، بخش قابل‌توجهی از سهمیه مصرفی را استفاده می‌کند. این بازخورد با یافته AA درباره تولید خروجی بیشتر هم‌جهت است، اما نمی‌توان آن را به همه کاربران و پلن‌ها تعمیم داد.

انجام کار بیشتر از حد نیاز: برخی کاربران Claude Code نیز گزارش کرده‌اند که مدل گاهی برای تغییرات ساده، مراحل بیشتری از حد لازم انجام می‌دهد یا پس از شکست، مسیر قبلی را دوباره تکرار می‌کند. برای تغییرات کوچک، پیشنهاد شده مدل به‌جای بازنویسی کامل فایل، فقط بخش موردنیاز را ویرایش کند تا مصرف توکن کاهش یابد.

نقاط قوت و ضعف؛ آیا فیبل ۵٫۱ ارزش استفاده دارد؟

فیبل ۵٫۱ بیشتر برای کارهای پیچیده، طولانی و عامل‌محور طراحی شده است تا پاسخ‌گویی سریع به درخواست‌های ساده. Artificial Analysis در داده زنده، سرعت تولید خروجی Fable 5.1 را حدود ۶۷٫۳ توکن در ثانیه گزارش می‌کند که همچنان پایین‌تر از میانگین حدود ۷۳ توکن در ثانیه مدل‌های مقایسه‌شده است. در مقابل، توانایی بالای مدل در استدلال، کدنویسی و انجام کارهای چندمرحله‌ای، نقطه قوت اصلی آن محسوب می‌شود.

نقاط قوت

  • استدلال بسیار قوی
  • بهبود چشمگیر در کدنویسی عامل‌محور و وظایف چندمرحله‌ای
  • عملکرد بسیار قوی در Terminal-Bench
  • رتبه اول در Code Arena: WebDev
  • کاهش ۷۵ درصدی هزینه خواندن داده‌های کش‌شده
  • توانایی بهتر در انجام کارهای طولانی و چندمرحله‌ای
  • خوانایی بهتر پاسخ‌ها در برخی تجربه‌های اولیه
  • پنجره متنی یک‌میلیون‌توکنی
  • توانایی کار با کدبیس‌ها و اسناد بزرگ
  • پشتیبانی از ورودی متن و تصویر

نقاط ضعف

  • هزینه بالای خروجی؛ ۵۰ دلار به‌ازای هر میلیون توکن
  • مصرف بالای توکن در برخی کارهای طولانی
  • احتمال مصرف سریع‌تر سهمیه در نشست‌های طولانی
  • سرعت خروجی متوسط؛ حدود ۶۶ توکن در ثانیه
  • هزینه هر کار لزوما کمتر از Fable 5 نیست
  • برای کارهای ساده ممکن است بیش از حد پرهزینه باشد
  • برخی گزارش‌ها از پردازش بیش از حد یا تکرار مسیرهای ناموفق

بااین‌حال، انتخاب مدل مناسب فقط به هوش آن بستگی ندارد و هزینه و نوع کار نیز اهمیت زیادی دارند.

مدل

نقطهٔ قوت اصلی

قیمت Input / Output

برداشت کلی

Fable 5.1

کارهای طولانی و کدنویسی عامل‌محور

۱۰ / ۵۰ دلار

عملکرد بسیار بالا، اما گران

Opus 5

استدلال عمومی

۵ / ۲۵ دلار

متعادل‌تر

Fable 5

کارهای عامل‌محور

۱۰ / ۵۰ دلار

نسل قبلی، همچنان قدرتمند

GPT-5.6 Sol

استدلال و کدنویسی

۴ / ۲۰ دلار

رقیب جدی با هزینه کمتر

Qwen3.8 Max

کدنویسی و توسعهٔ وب

۲ / ۶ دلار

عملکرد رقابتی با قیمت پایین‌تر

Kimi K3 Max

کدنویسی و توسعهٔ وب

۳ / ۱۵ دلار

قدرتمند در کدنویسی

Grok 4.6 High

استفادهٔ عمومی

۲ / ۶ دلار

ارزان‌تر و رقابتی

Gemini 3.7 Flash

سرعت و کارهای عامل‌محور

۰٫۷۵ / ۳٫۷۵ دلار*

گزینه‌ای اقتصادی برای حجم بالای کار

Fable 5.1 انتخاب مناسبی است اگر:

  • وظایف کدنویسی شما چندمرحله‌ای و طولانی هستند؛
  • ایجنت شما باید ساعت‌ها روی یک پروژه کار کند؛
  • به تحلیل اسناد و داده‌های حجیم نیاز دارید؛
  • کیفیت استدلال از سرعت و هزینه مهم‌تر است؛
  • مقدار زیادی کانتکست تکراری دارید و cache read ارزان برایتان اهمیت دارد.

در نتیجه، Fable 5.1 زمانی انتخاب جذاب‌تری است که کیفیت استدلال و توانایی انجام کارهای پیچیده از هزینه و سرعت مهم‌تر باشد؛ به‌ویژه برای کدنویسی روی پروژه‌های بزرگ، کارهای چندمرحله‌ای و استفاده از ایجنت‌ها. در مقابل، برای پرسش‌های ساده، تولید محتوای کوتاه یا کارهایی که سرعت و هزینه اهمیت بیشتری دارند، مدل‌های ارزان‌تر می‌توانند انتخاب منطقی‌تری باشند.

به‌نظر شما Fable 5.1 می‌تواند انتخاب اول توسعه‌دهندگان برای پروژه‌های عامل‌محور باشد یا هزینه بالای استفاده همچنان برتری آن را محدود می‌کند؟