آنتروپیک با معرفی کلاد فیبل ۵٫۱ در اول سپتامبر ۲۰۲۶، نسخهای جدید از مدل پرچمدار خود را با تمرکز روی کدنویسی طولانیمدت، پژوهش چندمرحلهای و کارهای عاملمحور عرضه کرد. فیبل ۵٫۱ همان مدل پایهای است که پشت کلاد Mythos 5.1 قرار دارد؛ با این تفاوت که برای استفاده عمومی، لایههای ایمنی سختگیرانهتری در حوزههای زیستشناسی و امنیت سایبری روی آن اعمال شده است.
مدل جدید با پنجره زمینه یکمیلیونتوکنی و حداکثر خروجی ۱۲۸ هزار توکن عرضه میشود و قیمت ورودی و خروجی آن نسبت به فیبل ۵ تغییری نکرده است؛ بااینحال، هزینه خواندن دادههای کششده ۷۵ درصد کاهش یافته است. تمرکز اصلی فیبل ۵٫۱ برخلاف چتباتهای معمولی، پاسخدادن به درخواستهای کوتاه نیست. آنتروپیک میخواهد این مدل بتواند پروژههای چندمرحلهای را برای ساعتها یا حتی چند روز دنبال کند، ابزارهای مختلف را بهکار بگیرد، نتیجهی کار خود را بررسی کند و در صورت شکست یک مرحله، مسیر دیگری را امتحان کند.
مدل فیبل ۵٫۱ مدت کوتاهی پس از انتشار، توانست به صدر جدول Code Arena: WebDev راه یابد و در پنج بخش از شش حوزه اصلی آن بیشترین امتیاز را به دست آورد. این دستاورد به همراه ارزیابی مستقل Artificial Analysis، دید شفافتری از وضعیت این مدل در مقایسه با نسل پیشین و رقبای سرسخت آن فراهم میکند. در ادامه، عملکرد این مدل را دقیقتر بررسی میکنیم.
Fable 5.1 چیست و چرا مهم است؟
فیبل ۵٫۱ جدیدترین مدل آنتروپیک برای استدلال سنگین، کدنویسی عاملمحور، کارهای دانشمحور و وظایف طولانیمدت است. فیبل ۵٫۱ در اول سپتامبر ۲۰۲۶، همزمان با کلاد Mythos 5.1 معرفی شد. هر دو مدل بر پایه یک مدل مشترک ساخته شدهاند، اما میتوس ۵٫۱ هنوز برای عموم در دسترس نیست و دسترسی به آن بهصورت محدود ارائه میشود.
فیبل ۵٫۱ برای کارهایی طراحی شده که ممکن است ساعتها ادامه داشته باشند و مدل در آنها باید میان چند مرحله، فایل، ابزار و تصمیم مختلف ارتباط برقرار کند. به بیان ساده، هدف فیبل ۵٫۱ این نیست که فقط پاسخ بهتری به یک پرامپت بدهد؛ بلکه قرار است بخش بزرگتری از یک پروژه را بهصورت مستقل جلو ببرد. برای مثال، در یک پروژه نرمافزاری میتواند کدبیس را بررسی کند، feature جدید اضافه کند، تستها را اجرا کند، خطاها را بررسی کند و در ادامه کد را اصلاح کند.
فیبل ۵٫۱ همان مدل پایه میتوس ۵٫۱ است که تفاوتشان در تدابیر امنیتی است
فیبل ۵٫۱ نسخهای است که آنتروپبک برای استفاده عمومیتر با تدابیر امنیتی دقیقتر عرضه کرده است. این موضوع توضیح میدهد چرا آنتروپیک میتواند تواناییهای بسیار پیشرفته میتوس را در قالب فیبل برای کاربران عمومیتر ارائه کند
Fable 5.1 چه قابلیتهایی دارد؟
تمرکز اصلی فیبل ۵٫۱ را میتوان در چهار حوزه کلیدی خلاصه کرد: کدنویسی در پروژههای بلندمدت، پژوهش عاملمحور، کار با اسناد و فعالیتهای دانشی و استفاده از ابزارها.
سازنده | آنتروپیک |
تاریخ عرضه | ۱ سپتامبر ۲۰۲۶ |
مدل پایه | نسل جدید Fable / همان مدل زیربنایی Mythos 5.1 |
پنجره کانتکست | ۱ میلیون توکن |
حداکثر خروجی | ۱۲۸ هزار توکن |
Thinking | استدلال تطبیقی (Adaptive)؛ همیشه فعال |
ورودی | متن و تصویر |
خروجی | متن |
دانش قابل اتکا تا | ژوئن ۲۰۲۶ |
سرعت نسبی | کندتر از Opus 5 |
قیمت ورودی | ۱۰ دلار / یک میلیون توکن |
قیمت خروجی | ۵۰ دلار / یک میلیون توکن |
Cache read (خواندن از کش) | ۰٫۲۵ دلار / یک میلیون توکن |
Cache write (نوشتن در کش) پنجدقیقهای | ۱۲٫۵ دلار / یک میلیون توکن |
Cache write یکساعته | ۲۰ دلار / یک میلیون توکن |
وضعیت | فعال |
فیبل ۵٫۱ برای کدنویسی عاملمحور طراحی شده و میتواند وظایف پیچیده نرمافزاری را از ابتدا تا انتها دنبال کند؛ از کار روی کدبیسهای بزرگ و افزودن قابلیتهای جدید تا بازبینی و بهینهسازی کد. این مدل همچنین در مقایسه با نسل قبل، در تشخیص بنبست و گزارشکردن مشکلات عملکرد بهتری دارد.
این مدل علاوه بر برنامهنویسی، برای پژوهش چندمرحلهای و کار با اسناد، صفحههای گسترده و ارائهها نیز بهینه شده است و میتواند اطلاعات را از منابع مختلف جمعآوری، مقایسه و در قالب یک خروجی منسجم ارائه کند.
فیبل ۵٫۱ از استدلال تطبیقی بهره میبرد و کاربران میتوانند میزان تلاش مدل برای استدلال را متناسب با پیچیدگی کار تنظیم کنند. این قابلیت به ایجاد تعادل میان کیفیت پاسخ و مصرف توکن کمک میکند.
این مدل مانند فیبل ۵ از پنجره متنی یکمیلیونتوکنی پشتیبانی میکند؛ ظرفیتی که امکان کار با اسناد طولانی، کدبیسهای بزرگ و فرایندهای چندمرحلهای را فراهم میکند، اما در فیبل ۵٫۱ استفاده از این ظرفیت بهینهتر شده است.
Mythos 5.1 چه تفاوتی با Fable 5.1 دارد؟
فیبل ۵٫۱ و میتوس ۵٫۱ از یک مدل پایه استفاده میکنند، اما در سطح دسترسی و محدودیتهای ایمنی تفاوت دارند. فیبل ۵٫۱ برای استفاده عمومی عرضه شده است، درحالیکه میتوس ۵٫۱ در حال حاضر تنها از طریق دو برنامه دسترسی ویژه در اختیار سازمانهای تأییدشده آمریکایی قرار میگیرد.
فیبل ۵٫۱ و میتوس ۵٫۱ در سطح دسترسی و محدودیتهای ایمنی تفاوت دارند
در حوزه علوم زیستی، آنتروپیک اعلام کرده نخستین شرکتکنندگان را با همکاری دولت آمریکا ثبتنام کرده و قصد دارد بهزودی ثبتنام را برای جامعه گستردهتر پژوهشگران باز کند.
در حوزه امنیت سایبری نیز دسترسی به مدلهای رده میتوس هنوز فعال نشده و برنامه تأیید امنیت سایبری (CVP) فعلاً مدلهای رده اوپوس را پوشش میدهد؛ آنتروپیک اعلام کرده که قصد دارد در آینده نزدیک دسترسی به رده میتوس را نیز به این برنامه اضافه کند.
ویژگی | فیبل ۵٫۱ | میتوس ۵٫۱ |
|---|---|---|
مدل پایه | یکسان | یکسان |
پنجرهٔ متنی | ۱ میلیون توکن | ۱ میلیون توکن |
حداکثر خروجی | ۱۲۸ هزار توکن | ۱۲۸ هزار توکن |
قیمت API | ۱۰ / ۵۰ دلار | ۱۰ / ۵۰ دلار |
دسترسی | عمومی | محدود |
محدودیتهای امنیت سایبری | فعال | دسترسی ویژه از مسیر Cyber Verification در آینده نزدیک اعلام |
محدودیتهای علوم زیستی | فعال | دسترسی محدود و دعوتمحور برای سازمانهای تأییدشده |
هدف اصلی | کدنویسی و کارهای دانشی | پژوهش در امنیت سایبری و علوم زیستی |
تفاوت اصلی این دو مدل در سطح دسترسی و سازوکارهای ایمنی است، نه ظرفیت پردازشی پایه. فیبل ۵٫۱ با محدودیتهای ایمنی بیشتر برای استفاده عمومی ارائه شده است.
میتوس ۵٫۱ در حال حاضر فقط از طریق دو برنامه دسترسی ویژه در اختیار سازمانهای تأییدشده آمریکایی قرار میگیرد
برای مثال، فیبل ۵٫۱ میتواند آسیبپذیریهای نرمافزاری را در کد شناسایی کند، اما برخی فعالیتهای پرخطر مانند تولید اکسپلویت و نفوذ آزمایشی همچنان محدود هستند. میتوس ۵٫۱ در واقع نسخهای با دسترسی کنترلشده و محدودیتهای ایمنی متفاوت از همان مدل پایه است.
Fable 5.1 در مقایسه با Fable 5 چقدر بهتر شده است؟
اگر مشخصات فنی دو مدل را کنار هم بگذاریم، تفاوت چندان بزرگ نیست؛ هر دو یکمیلیون توکن کانتکست و ۱۲۸ هزار توکن خروجی دارند و قیمت عادی ورودی و خروجی نیز یکسان است. جهش اصلی فیبل ۵٫۱ در توانایی مدل برای انجام وظایف پیچیده و همچنین هزینه cache read اتفاق افتاده است.
مقایسه مشخصات Fable 5.1 و Fable 5
ویژگی | Fable 5.1 | Fable 5 | تغییر |
|---|---|---|---|
کانتکست | ۱ میلیون | ۱ میلیون | بدون تغییر |
حداکثر خروجی | ۱۲۸ هزار | ۱۲۸ هزار | بدون تغییر |
قیمت input | ۱۰ دلار | ۱۰ دلار | بدون تغییر |
قیمت output | ۵۰ دلار | ۵۰ دلار | بدون تغییر |
Cache read | ۰٫۲۵ دلار | ۱ دلار | ۷۵٪ ارزانتر |
Thinking | Adaptive | Adaptive | بهبود در رفتار و کنترل effort |
تمرکز | عاملهای خودمختار برای وظایف طولانیمدت، کدنویسی و پژوهش | کدنویسی و کارهای عاملمحور | تمرکز عمیقتر روی وظایف طولانی |
تاریخ عرضه | سپتامبر ۲۰۲۶ | ژوئن ۲۰۲۶ | — |
آنتروپیک میگوید کاهش هزینه خواندن از کش میتواند هزینه اجرای بارهای کاری معمولی را حدود ۲۵ درصد و بارهای کاری بسیار عاملمحور را تا حدود ۴۵ درصد کاهش دهد. البته این ارقام برآورد خود آنتروپیک هستند و نباید آنها را بهعنوان کاهش قطعی هزینه برای همه وظایف در نظر گرفت.
بنچمارکهای رسمی آنتروپیک درباره فیبل ۵٫۱ چه میگویند؟
برای بررسی عملکرد فیبل ۵٫۱، آنتروپیک مجموعهای از آزمونهای مربوط به کدنویسی، استدلال، کار با کامپیوتر و کارهای دانشی را منتشر کرده است.
بنچمارک | چه چیزی را میسنجد؟ | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
Terminal-Bench-Science 0.1 | پژوهش علمی عاملمحور در ترمینال | ۵۲٫۶٪ | ۲۴٫۷٪ | ۲۹٫۰٪ | ۲۲٫۴٪ |
Terminal-Bench 4.0 | کدنویسی و حل مسئله چندمرحلهای در ترمینال | ۵۵٫۸٪ | ۴۲٫۰٪ | ۵۲٫۳٪ | ۳۷٫۳٪ |
GDPval-AA v2 | وظایف حرفهای و دانشمحور | ۱۸۵۳ Elo | ۱۷۲۳ | ۱۸۲۴ | ۱۷۱۱ |
OSWorld 2.0 — partial | انجام وظایف روی محیط کامپیوتری | ۷۷٫۹٪ | ۷۲٫۹٪ | ۷۵٫۴٪ | — |
OSWorld 2.0 — strict | اجرای دقیقتر وظایف کامپیوتری | ۴۱٫۷٪ | ۳۶٫۱٪ | ۳۹٫۶٪ | — |
Humanity’s Last Exam | دانش و استدلال در مسائل بسیار دشوار | ۶۰٫۹٪ | ۵۷٫۸٪ | ۵۶٫۶٪ | — |
Humanity’s Last Exam + tools | HLE همراه با ابزار | ۶۵٫۰٪ | ۶۳٫۸٪ | ۶۳٫۶٪ | — |
AutomationBench | اجرای ورکفلوهای عاملمحور | ۳۱٫۴٪ | ۱۷٫۱٪ | ۲۶٫۹٪ | ۱۹٫۶٪ |
CursorBench 3.2.0 | کدنویسی در ورکفلو محیط IDE | ۷۳٫۴٪ | ۷۰٫۵٪ | ۷۰٫۰٪ | ۶۷٫۲٪ |
این نتایج مربوط به ارزیابیهای خود آنتروپیک هستند و بعضی از آزمونها نیز تحت شرایط مشخصی انجام شدهاند. برای مثال، در آزمون Terminal-Bench-Science، خطای استاندارد نتایج مدلها حدود ۳٫۵ تا ۴٫۵ واحد است؛ بنابراین، اختلافهای کوچک بین امتیازها لزوماً معنادار نیستند. همچنین، امتیازهای OSWorld بر اساس مجموعه وظایفی هستند که در آگوست ۲۰۲۶ منتشر شدهاند و به همین دلیل، مقایسه مستقیم آنها با نتایج نسخههای قبلی این آزمون درست نیست.
بزرگترین جهش فیبل ۵٫۱ کجاست؟
یکی از چشمگیرترین نتایج در Terminal-Bench-Science، که توانایی مدل در انجام پژوهش علمی عاملمحور در محیط ترمینال را میسنجد، به دست آمده است. امتیاز فیبل ۵٫۱ در این آزمون از ۲۴٫۷ درصد در فیبل ۵ به ۵۲٫۶ درصد رسیده؛ یعنی ۲۷٫۹ واحد درصد افزایش.
در Terminal-Bench 4.0 نیز که کدنویسی و حل مسائل چندمرحلهای در محیط ترمینال را ارزیابی میکند، امتیاز مدل از ۴۲ درصد به ۵۵٫۸ درصد افزایش یافته است.
در مقابل، میزان بهبود در آزمونهای دیگر محدودتر بوده است. در HLE بدون ابزار، که توانایی مدل در پاسخگویی به پرسشهای دشوار در حوزههای مختلف را بدون دسترسی به ابزارها میسنجد، امتیاز از ۵۷٫۸ به ۶۰٫۹ درصد رسیده است.
نمودار رسمی آنتروپیک برای این آزمون در سطوح مختلف تلاش (از low تا max) نیز همین روند را نشان میدهد؛ در هر سطح هزینهی مشخص، فیبل ۵٫۱ نسبت به فیبل ۵ دقت بالاتری ثبت کرده است. برای نمونه، فیبل ۵٫۱ در حالت استفاده از ابزار و حداکثر تلاش به ۶۵ درصد میرسد، درحالیکه فیبل ۵ برای رسیدن به ۶۳٫۸ درصد باید هزینهی بیشتری صرف کند.
پیشرفت فیبل ۵٫۱ در وظایفی دیده میشود که نیازمند اجرای چندمرحلهای و استفاده از ابزار هستند
در CursorBench نیز که عملکرد مدل را در انجام وظایف واقعی کدنویسی در محیط ویرایشگر Cursor ارزیابی میکند، امتیاز از ۷۰٫۵ به ۷۳٫۴ درصد افزایش یافته است.
بنابراین بهنظر میرسد بیشترین پیشرفت فیبل ۵٫۱ در وظایفی دیده میشود که نیازمند اجرای چندمرحلهای و استفاده از ابزار هستند، نه صرفاً پاسخدادن به یک پرسش منفرد.
بنچمارکهای مستقل درباره فیبل ۵٫۱ چه میگویند؟
در ادامه، برای درک بهتر عملکرد فیبل ۵٫۱ فراتر از آنچه آنتروپیک میگوید، بهتر است نتایج ارزیابیهای مستقل را مرور کنیم. این ارزیابیها از آن جهت اهمیت دارند که شرایط آزمون در آنها مستقل از جدول رسمی آنتروپیک است.
ارزیابیهای Artificial Analysis از فیبل ۵٫۱
در کنار نتایج آنتروپیک، Artificial Analysis نیز پیش از عرضه عمومی، Fable 5.1 را ارزیابی کرده است. این مجموعه در شاخص هوش خود، فیبل ۵٫۱ را در حالت Max با امتیاز ۶۶ در رتبه نخست قرار داده است.
فیبل ۵٫۱ در این شاخص چهار امتیاز بیشتر از فیبل ۵ کسب کرده و به بالاترین امتیازی رسیده است که Artificial Analysis یا همان AA تا زمان انجام این ارزیابی ثبت کرده بود.
این ارزیابی با سازوکار فالبک (fallback) پیشفرض آنتروپیک انجام شده است؛ یعنی اگر سامانههای حفاظتی Anthropic یک درخواست را مشکوک یا نامناسب تشخیص میدادند، آن درخواست ممکن بود بهجای فیبل ۵٫۱ به اپوس ۴٫۸ یا اپوس ۵ منتقل شود. در مجموع، حدود ۴ درصد از توکنهای خروجی این ارزیابی از این مدلهای جایگزین تولید شدهاند. بنابراین، امتیاز ۶۶ را باید بهعنوان نتیجه فیبل ۵٫۱ در این شرایط ارزیابی در نظر گرفت، نه یک سنجش کاملاً مجزا از عملکرد خود مدل؛ بااینحال، از این داده بهتنهایی نمیتوان میزان تأثیر fallback بر امتیاز نهایی را تعیین کرد.
بنچمارک مستقل | چه چیزی را میسنجد؟ | Fable 5.1 | Fable 5 | نکته |
|---|---|---|---|---|
HLE | دانش و استدلال در مسائل بسیار دشوار و چندرشتهای | ۵۹٫۱٪ | ۵۵٫۵٪ | Fable 5.1 حدود ۳٫۶ واحد درصد بهتر است و بالاترین نتیجه ثبتشده AA در زمان ارزیابی را کسب کرده است. |
Terminal-Bench v2.1 | توانایی مدل در اجرای وظایف پیچیده کدنویسی و حل مسئله در محیط ترمینال | ۹۱٫۴٪ | حدود ۸۵٪ | Fable 5.1 بالاترین امتیاز اندازهگیریشده را ثبت کرده است. امتیاز ۸۵٪ مربوط به snapshot ارزیابی AA در ۳۰ جولای ۲۰۲۶ است. |
SciCode | توانایی حل مسائل علمی و تولید یا اصلاح کدهای مرتبط با پژوهشهای علمی | ۶۲٫۰٪ | ۶۰٫۲٪ | Fable 5.1 با اختلاف ۱٫۸ واحد درصد بالاتر است و در زمان ارزیابی رتبه نخست را داشته است. |
GDPval-AA v2 | عملکرد مدل در انجام وظایف حرفهای و دانشمحور در مشاغل مختلف | ۱۸۵۳ Elo | ۱۷۲۳ Elo | Fable 5.1 حدود ۱۳۰ Elo بالاتر از Fable 5 قرار گرفته است. |
AA-Briefcase | توانایی انجام مجموعهای از وظایف واقعی اداری، تحلیلی و حرفهای، ازجمله تحلیل و ارائه اطلاعات | ۱۶۹۴ Elo | ۱۵۷۲ Elo | Fable 5.1 حدود ۱۲۲ Elo بالاتر از Fable 5 است؛ هرچند اختلاف آن با Opus 5 بسیار کوچک است. |
AA-Omniscience accuracy | درصد پاسخهای درست (Raw Accuracy) در ارزیابی AA-Omniscience؛ این شاخص بهتنهایی معیار «تشخیص میزان اطمینان» یا «پرهیز از hallucination» نیست | ۶۷٫۲٪ | ۶۵٫۴٪ | دقت خام Fable 5.1 حدود ۱٫۸ واحد درصد بیشتر است؛ بااینحال، بهدلیل نرخ تلاش و حدس بیشتر، امتیاز کلی AA-Omniscience دو مدل تقریباً برابر باقی مانده است. |
در آزمون HLE، مدل فیبل ۵٫۱ توانسته به ۵۹٫۱ درصد پاسخ درست برسد و عملکرد بهتری از فیبل ۵ داشته باشد. همچنین در آزمون Terminal-Bench v2.1 که توانایی مدل در انجام وظایف کدنویسی و کار با ترمینال را میسنجد، امتیاز ۹۱٫۴ درصد گرفته است. در آزمون SciCode نیز که برای ارزیابی توانایی مدل در حل مسائل علمی و نوشتن کدهای مرتبط طراحی شده، امتیاز ۶۲ درصد بهدست آورده است.
فیبل ۵٫۱ در انجام کارهایی مانند تحلیل، نگارش حرفهای، پردازش اطلاعات و حل مسائل پیچیده عملکرد بسیار قدرتمندی دارد
در GDPval-AA v2، مدلها با استفاده از سیستم امتیازدهی Elo با یکدیگر مقایسه میشوند؛ روشی مشابه رتبهبندی بازیکنان شطرنج که در آن مدلها پاسخهای یکدیگر را در مجموعهای از وظایف حرفهای و دانشمحور مقایسه میکنند.
در این ارزیابی مستقل، فیبل ۵٫۱ Max امتیاز ۱۸۵۳ Elo بهدست آورد و بالاتر از اپوس ۵ Max با امتیاز ۱۸۲۴ و فیبل ۵ Max با ۱۷۲۳ قرار گرفت.
مدل | GDPval-AA v2 |
|---|---|
Fable 5.1 Max | ۱۸۵۳ Elo |
Opus 5 Max | ۱۸۲۴ Elo |
Fable 5 Max | ۱۷۲۳ Elo |
این نتیجه نشان میدهد فیبل ۵٫۱ در انجام کارهایی مانند تحلیل، نگارش حرفهای، پردازش اطلاعات و حل مسائل پیچیده عملکرد بسیار قدرتمندی دارد؛ بااینحال، اختلاف آن با اپوس ۵ چندان زیاد نیست و بهتنهایی نمیتواند برتری قطعی فیبل ۵٫۱ را ثابت کند.
بااینحال، اختلاف ۲۹ امتیازی فیبل ۵٫۱ و اپوس ۵ از نظر آماری قطعی نیست و فاصله اطمینان دو مدل همپوشانی دارد. بنابراین بهتر است بگوییم فیبل ۵٫۱ در این ارزیابی بالاتر قرار گرفته، نه اینکه با قطعیت اپوس ۵ را شکست داده است.
در AA-Briefcase که عملکرد مدلها را در وظایف ترکیبی دانشمحور و حرفهای نشان میدهد، عملکرد دو مدل بسیار نزدیک به هم است.
مدل | AA-Briefcase | کیفیت تحلیلی | ارائه |
|---|---|---|---|
Fable 5.1 | ۱۶۹۴ | ۲۰۲۵ | ۱۴۹۵ |
Opus 5 | ۱۶۸۵ | ۱۹۸۰ | ۱۵۷۲ |
فیبل ۵٫۱ امتیاز بالاتری گرفته است؛ یعنی درک مسئله، بررسی جزئیات، دنبالکردن ارتباط میان اطلاعات و رسیدن به نتیجه منطقی عملکرد بهتری داشته است. در مقابل، اپوس ۵ در بخش ارائه امتیاز بیشتری کسب کرده؛ یعنی پاسخهایش معمولاً ساختار منظمتر، توضیح روانتر و خروجی نهایی خواناتری داشتهاند.
به زبان ساده، فیبل ۵٫۱ ممکن است تحلیل عمیقتر و دقیقتری ارائه دهد، اما اپوس ۵ میتواند همان نتیجه را مرتبتر و قابلفهمتر به کاربر تحویل دهد. به همین دلیل، با اینکه فیبل ۵٫۱ در امتیاز تحلیلی جلوتر است، اختلاف امتیاز کلی دو مدل زیاد نیست و نمیتوان گفت در همه جنبهها برتری محسوسی نسبت به اپوس ۵ دارد.
ارزیابیهای Code Arena از فیبل ۵٫۱
یکی از مهمترین نتایج پس از عرضه فیبل ۵٫۱، عملکرد آن در Code Arena: WebDev است؛ رتبهبندیای که مدلها را در وظایف توسعه وب و جریانهای کاری عاملمحور، با رأی کاربران ارزیابی میکند. در اسنپشات عمومی قابلتأیید Code Arena در ۲ سپتامبر ۲۰۲۶، Fable 5.1 Max با امتیاز ۱۷۶۵ و ۱٬۱۰۶ رأی برای خود مدل در رتبه نخست قرار داشت؛ مجموع رأیهای Arena در آن اسنپشات ۶۴۰٬۸۰۶ بود.
رتبه | مدل | امتیاز | قیمت API |
|---|---|---|---|
🥇 ۱ | Fable 5.1 Max | ۱۷۶۵ | ۱۰ / ۵۰ دلار |
🥈 ۲ | Qwen3.8-Max-0902 | ۱۶۸۹ | ۲ / ۶ دلار |
🥉 ۳ | Opus 5 Max | ۱۶۸۷ | ۵ / ۲۵ دلار |
۴ | Kimi K3 Max | ۱۶۷۴ | ۳ / ۱۵ دلار |
۵ | Qwen3.8-Max | ۱۶۷۰ | ۲ / ۶ دلار |
۶ | Opus 5 High | ۱۶۶۲ | ۵ / ۲۵ دلار |
۷ | Fable 5 | ۱۶۲۹ | ۱۰ / ۵۰ دلار |
۸ | Grok 4.6 High | ۱۶۲۵ | ۲ / ۶ دلار |
۹ | Qwen3.8-Flash-Next | ۱۶۲۵ | ۰٫۱۶ / ۰٫۴۷ دلار |
۱۰ | Hy4 Preview | ۱۶۲۳ | ۰٫۸۳ / ۲٫۵۰ دلار |
۱۲ | GLM 5.3 Max | ۱۶۱۱ | ۱٫۴۰ / ۴٫۴۰ دلار |
۱۶ | Gemini 3.7 Flash High | ۱۵۸۷ | ۰٫۷۵ / ۳٫۷۵ دلار |
۱۸ | DeepSeek V4 Pro High | ۱۵۸۲ | ۱٫۳۲ / ۳٫۹۶ دلار |
در اسنپشات عمومی دوم سپتامبر، فیبل ۵٫۱ مکس ۷۷ امتیاز بالاتر از Qwen3.8-Max-0902 با امتیاز ۱۶۸۸ و ۷۸ امتیاز بالاتر از اپوس ۵ مکس با امتیاز ۱۶۸۷ قرار داشت. فاصله آن با فیبل ۵ برابر با ۱۳۷ امتیاز بود.
ارقام جدول نسبت به زمان انتشاردر ۲ سپتامبر کمی تغییر کردهاند. هنگام عرضه، فیبل ۵٫۱ مکس با ۱۷۶۵ امتیاز صدرنشین بود؛ اکنون امتیاز آن به ۱۷۶۳ رسیده، درحالیکه فیبل ۵ نیز از ۱۶۲۸ به ۱۶۲۹ رسیده است. بنابراین برتری فیبل ۵٫۱ مکس نسبت به نسل قبل همچنان پابرجاست، اما اختلاف فعلی ۱۳۴ امتیاز است.
حوزه | Fable 5.1 Max | Fable 5 Max | رشد |
|---|---|---|---|
عملکرد کلی | ۱۷۶۵ | ۱۶۲۸ | +۱۳۷ |
Gaming (بازی) | ۱۹۳۴ | ۱۷۰۰ | +۲۳۴ |
Simulations (شبیهسازی) | ۱۸۶۹ | ۱۶۷۳ | +۱۹۶ |
Reference-Based Design (طراحی مبتنی بر مرجع) | ۱۸۱۳ | ۱۶۵۳ | +۱۶۰ |
Brand & Marketing (برند و بازاریابی) | ۱۷۵۷ | ۱۶۲۵ | +۱۳۲ |
Consumer Product (محصولات مصرفی) | ۱۶۵۳ | ۱۵۶۵ | +۸۸ |
Data & Analytics (داده و تحلیل) | ۱۵۷۰ | ۱۵۵۳ | +۱۷ |
بر اساس دادههای Arena در زمان انتشار، فیبل ۵٫۱ مکس در هر شش حوزه نسبت به فیبل ۵ مکس امتیاز بالاتری کسب کرد؛ بیشترین رشد به حوزههای گیمینگ و شبیهسازی اختصاص داشت. این مدل در پنج حوزه از شش حوزه در رتبه نخست قرار گرفت اما در بخش داده و تحلیل به رتبه اول نرسید.
این نتایج را میتوان نشانهای مستقل از بهبود عملکرد فیبل ۵٫۱ نسبت به نسل قبل، بهویژه در کارهای عاملمحور و توسعه وب، دانست؛ بااینحال، نباید آنها را با نتایج یک آزمون آزمایشگاهی کنترلشده یکی دانست. همچنین، فیبل ۵٫۱ در زمان انتشار رأیهای بسیار کمتری نسبت به برخی مدلهای قدیمیتر داشت و تعدادی از مدلهای رقیب، از جمله Qwen3.8-Max-0902، در Arena با برچسب «آزمایشی» نمایش داده میشدند.
قیمت Fable 5.1 چقدر است؟
قیمت پایه Fable 5.1 نسبت به Fable 5 تغییر نکرده است، اما هزینهٔ خواندن دادههای کششده (Cache Read) بهطور چشمگیری کاهش یافته است. قیمت ورودی و خروجی این مدل بهترتیب ۱۰ و ۵۰ دلار بهازای هر یک میلیون توکن است؛ درحالیکه هزینه خواندن دادههای کششده از ۱ دلار در فیبل ۵ به ۰٫۲۵ دلار در فیبل ۵٫۱ رسیده است.
قیمت پایه Fable 5.1 نسبت به Fable 5 تغییر نکرده است، اما هزینه خواندن دادههای کششده (Cache Read) بهطور چشمگیری کاهش یافته است. قیمت ورودی و خروجی این مدل بهترتیب ۱۰ و ۵۰ دلار بهازای هر یک میلیون توکن است؛ درحالیکه هزینه خواندن دادههای کششده از ۱ دلار در فیبل ۵ به ۰٫۲۵ دلار در فیبل ۵٫۱ رسیده است.
آنتروپیک میگوید این کاهش میتواند هزینه بارهای کاری معمول را حدود ۲۵ درصد و بارهای کاری بسیار عاملمحور را تا حدود ۴۵ درصد کاهش دهد.
مدل | Input / ۱M | Output / ۱M | Cache Read / ۱M | پنجره متنی |
|---|---|---|---|---|
Fable 5.1 | ۱۰ دلار | ۵۰ دلار | ۰٫۲۵ دلار | ۱M |
Fable 5 | ۱۰ دلار | ۵۰ دلار | ۱ دلار | ۱M |
Opus 5 | ۵ دلار | ۲۵ دلار | ۰٫۵۰ دلار | ۱M |
Sonnet 5 | ۲ دلار | ۱۰ دلار | ۰٫۲۰ دلار | ۱M |
در نتیجه، فیبل ۵٫۱ برای هر یک میلیون توکن ورودی و خروجی، دو برابر Opus 5 و پنج برابر Sonnet 5 قیمت دارد؛ در مقابل، هزینه خواندن دادههای کششده در آن یکچهارم فیبل ۵ است. بااینحال، هزینه واقعی استفاده فقط از روی نرخ API مشخص نمیشود و به میزان توکن مصرفی در هر کار نیز بستگی دارد.
ارزیابی Artificial Analysis نشان میدهد فیبل ۵٫۱ مکس با وجود کاهش ۷۵ درصدی هزینه Cache Read، در آزمون Intelligence Index حدود ۳٫۷۶ دلار بهازای هر کار هزینه دارد؛ این رقم برای فیبل ۵ مکس حدود ۳٫۱۴ دلار است.
مدل / حالت | Intelligence Index | هزینه تقریبی هر کار |
|---|---|---|
Fable 5.1 Max | ۶۶ | ۳٫۷۶ دلار |
Fable 5 Max | ۶۲ | ۳٫۱۴ دلار |
Opus 5 Max | ۶۳ | ۲٫۳۴ دلار |
Fable 5.1 xhigh | ۶۵ | ۲٫۷۲ دلار |
AA دلیل اصلی این اختلاف را مصرف حدود ۱٫۷ برابر توکن خروجی در فیبل ۵٫۱ میداند. کاهش هزینه Cache Read حدود ۱٫۴ دلار از هزینه هر کار کم کرده، اما مصرف بیشتر توکن خروجی باعث شده هزینه نهایی فیبل ۵٫۱ مکس همچنان حدود ۲۰ درصد بیشتر از فیبل ۵ مکس (۳٫۷۶ در برابر ۳٫۱۴ دلار) باشد.
این الگو در بنچمارکهای دیگر هم دیده میشود؛ برای نمونه در Terminal-Bench v2.1 و در سطح High effort، فیبل ۵٫۱ برای هر کار نزدیک به ۱۵ هزار توکن (شامل پاسخ و استدلال) تولید میکند.
اگر فقط قیمت API را ببینیم، فیبل ۵٫۱ همان قیمت فیبل ۵ را دارد؛ اما اگر هزینه انجام یک کار کامل را در نظر بگیریم، هزینه ممکن است گرانتر تمام شود؛ زیرا مدل در برخی بارهای کاری توکن خروجی بسیار بیشتری تولید میکند.
اگر فقط قیمت API را ببینیم، فیبل ۵٫۱ همان قیمت فیبل ۵ را دارد
همین موضوع باعث شده Fable 5.1 Max با وجود تخفیف قابلتوجه در Cache Read، بر اساس ارقام زنده فعلی حدود ۲۰ درصد گرانتر از Fable 5 Max تمام شود. این مسئله برای ایجنتها اهمیت بیشتری دارد؛ زیرا یک ایجنت ممکن است در جریان یک کار طولانی، بارها اطلاعات قبلی را از کش بخواند و در عین حال حجم زیادی توکن خروجی تولید کند.
در نتیجه، Fable 5.1 را نمیتوان صرفاً یک مدل کمهزینهتر از Fable 5 دانست. مزیت اقتصادی آن بیشتر به نوع استفاده بستگی دارد: هرچه یک بار کاری بیشتر به خواندن مکرر اطلاعات کششده متکی باشد، کاهش هزینه Cache Read اهمیت بیشتری پیدا میکند؛ در مقابل، کارهایی که به تولید خروجی بسیار طولانی نیاز دارند، ممکن است همچنان هزینه بالاتری داشته باشند.
نحوه دسترسی به فیبل ۵٫۱
فیبل ۵٫۱ برای کاربران و سازمانها از طریق Claude در دسترس است و توسعهدهندگان نیز میتوانند از طریق Claude API به آن دسترسی داشته باشند. این مدل همچنین در بسترهای ابری Amazon Web Services، Google Cloud و Microsoft Foundry ارائه شده و در گیتهاب کوپلت نیز بهعنوان یک مدل عمومی و پایدار در دسترس است.
روش دسترسی | وضعیت |
|---|---|
Claude | ✅ |
Claude API | ✅ |
Claude Code | ✅ |
GitHub Copilot | ✅ |
Amazon Web Services | ✅ |
Google Cloud | ✅ |
Microsoft Foundry | ✅ |
فیبل ۵٫۱ در پلنهای پرو، مکس، تیم و سازمانی در دسترس است؛ اما نحوه محاسبه مصرف آن بسته به نوع پلن و صندلی متفاوت است. در پلن مکس، استفاده از فیبل ۵٫۱ از سهمیه عادی پلن کسر میشود. در مقابل، کاربران پرو و صندلیهای استاندارد در پلنهای تیم و سازمانی برای استفاده از این مدل باید از اعتبار مصرف استفاده کنند و مصرف فیبل ۵٫۱ از سهمیه عادی آنها کسر نمیشود.
تجربه کاربران از فیبل ۵٫۱ چگونه است؟
هنوز برای قضاوت قطعی درباره تجربه کاربران زود است؛ چون مدل تنها در اول سپتامبر عرضه شده، اما در روزهای نخست چند الگوی مشخص در ردیت و انجمنهای مرتبط دیده میشود.
عملکرد در کدبیسهای بزرگ: برخی کاربران از توانایی فیبل ۵٫۱ در دنبالکردن زنجیره فراخوانی میان دهها فایل و کار با اسناد طولانی رضایت داشتهاند. همچنین گزارشهایی از توانایی مدل در تشخیص تغییرات کدنویسی مشکلزا و مخالفت با آنها منتشر شده است.
خوانایی پاسخها: شماری از کاربران پاسخهای مدل را منسجمتر و خواناتر از فیبل ۵ و اپوس ۵ توصیف کردهاند؛ هرچند خوانایی بیشتر لزوماً به معنای دقت بالاتر نیست.
مصرف سریع سهمیه: یکی از انتقادهای پرتکرار، مصرف سریعتر سهمیه در نشستهای طولانی است. برخی کاربران گفتهاند مدل با چند درخواست سنگین، بخش قابلتوجهی از سهمیه مصرفی را استفاده میکند. این بازخورد با یافته AA درباره تولید خروجی بیشتر همجهت است، اما نمیتوان آن را به همه کاربران و پلنها تعمیم داد.
انجام کار بیشتر از حد نیاز: برخی کاربران Claude Code نیز گزارش کردهاند که مدل گاهی برای تغییرات ساده، مراحل بیشتری از حد لازم انجام میدهد یا پس از شکست، مسیر قبلی را دوباره تکرار میکند. برای تغییرات کوچک، پیشنهاد شده مدل بهجای بازنویسی کامل فایل، فقط بخش موردنیاز را ویرایش کند تا مصرف توکن کاهش یابد.
نقاط قوت و ضعف؛ آیا فیبل ۵٫۱ ارزش استفاده دارد؟
فیبل ۵٫۱ بیشتر برای کارهای پیچیده، طولانی و عاملمحور طراحی شده است تا پاسخگویی سریع به درخواستهای ساده. Artificial Analysis در داده زنده، سرعت تولید خروجی Fable 5.1 را حدود ۶۷٫۳ توکن در ثانیه گزارش میکند که همچنان پایینتر از میانگین حدود ۷۳ توکن در ثانیه مدلهای مقایسهشده است. در مقابل، توانایی بالای مدل در استدلال، کدنویسی و انجام کارهای چندمرحلهای، نقطه قوت اصلی آن محسوب میشود.
نقاط قوت
- استدلال بسیار قوی
- بهبود چشمگیر در کدنویسی عاملمحور و وظایف چندمرحلهای
- عملکرد بسیار قوی در Terminal-Bench
- رتبه اول در Code Arena: WebDev
- کاهش ۷۵ درصدی هزینه خواندن دادههای کششده
- توانایی بهتر در انجام کارهای طولانی و چندمرحلهای
- خوانایی بهتر پاسخها در برخی تجربههای اولیه
- پنجره متنی یکمیلیونتوکنی
- توانایی کار با کدبیسها و اسناد بزرگ
- پشتیبانی از ورودی متن و تصویر
نقاط ضعف
- هزینه بالای خروجی؛ ۵۰ دلار بهازای هر میلیون توکن
- مصرف بالای توکن در برخی کارهای طولانی
- احتمال مصرف سریعتر سهمیه در نشستهای طولانی
- سرعت خروجی متوسط؛ حدود ۶۶ توکن در ثانیه
- هزینه هر کار لزوما کمتر از Fable 5 نیست
- برای کارهای ساده ممکن است بیش از حد پرهزینه باشد
- برخی گزارشها از پردازش بیش از حد یا تکرار مسیرهای ناموفق
بااینحال، انتخاب مدل مناسب فقط به هوش آن بستگی ندارد و هزینه و نوع کار نیز اهمیت زیادی دارند.
مدل | نقطهٔ قوت اصلی | قیمت Input / Output | برداشت کلی |
|---|---|---|---|
Fable 5.1 | کارهای طولانی و کدنویسی عاملمحور | ۱۰ / ۵۰ دلار | عملکرد بسیار بالا، اما گران |
Opus 5 | استدلال عمومی | ۵ / ۲۵ دلار | متعادلتر |
Fable 5 | کارهای عاملمحور | ۱۰ / ۵۰ دلار | نسل قبلی، همچنان قدرتمند |
GPT-5.6 Sol | استدلال و کدنویسی | ۴ / ۲۰ دلار | رقیب جدی با هزینه کمتر |
Qwen3.8 Max | کدنویسی و توسعهٔ وب | ۲ / ۶ دلار | عملکرد رقابتی با قیمت پایینتر |
Kimi K3 Max | کدنویسی و توسعهٔ وب | ۳ / ۱۵ دلار | قدرتمند در کدنویسی |
Grok 4.6 High | استفادهٔ عمومی | ۲ / ۶ دلار | ارزانتر و رقابتی |
Gemini 3.7 Flash | سرعت و کارهای عاملمحور | ۰٫۷۵ / ۳٫۷۵ دلار* | گزینهای اقتصادی برای حجم بالای کار |
Fable 5.1 انتخاب مناسبی است اگر:
- وظایف کدنویسی شما چندمرحلهای و طولانی هستند؛
- ایجنت شما باید ساعتها روی یک پروژه کار کند؛
- به تحلیل اسناد و دادههای حجیم نیاز دارید؛
- کیفیت استدلال از سرعت و هزینه مهمتر است؛
- مقدار زیادی کانتکست تکراری دارید و cache read ارزان برایتان اهمیت دارد.
در نتیجه، Fable 5.1 زمانی انتخاب جذابتری است که کیفیت استدلال و توانایی انجام کارهای پیچیده از هزینه و سرعت مهمتر باشد؛ بهویژه برای کدنویسی روی پروژههای بزرگ، کارهای چندمرحلهای و استفاده از ایجنتها. در مقابل، برای پرسشهای ساده، تولید محتوای کوتاه یا کارهایی که سرعت و هزینه اهمیت بیشتری دارند، مدلهای ارزانتر میتوانند انتخاب منطقیتری باشند.
بهنظر شما Fable 5.1 میتواند انتخاب اول توسعهدهندگان برای پروژههای عاملمحور باشد یا هزینه بالای استفاده همچنان برتری آن را محدود میکند؟