آنتروپیک دومین عضو از خانوادهی مدلهای جدید خود را با نام Claude Sonnet 5.5 به نمایش گذاشت. مدل یادشده ارتقای چشمگیری نسبت به Sonnet 5 به شمار میرود و ضمن اجرای بیش از ۳۰ درصد سریعتر دستورها، هزینهی پردازش اکثر کارها را تا حدود ۳۰ درصد کاهش میدهد.
هوش مصنوعی Claude Sonnet 5.5 بهعنوان مکملی سریعتر و اقتصادیتر برای Claude Opus 5.5 طراحی شده است. مدل پرچمدار Opus 5.5 برای وظایف بسیار پیچیده و نیازمند قضاوت عمیق به کار میرود، درحالیکه Sonnet 5.5 بالاترین توان خود را در وظایف روزمرهی مشخص، رفع باگهای نرمافزاری و تولید اسناد، ارائهها و صفحات گستردهی حرفهای نشان میدهد.
آنتروپیک همچنین اعلام کرده است که مدل سبکتر Claude Haiku 5.5 برای پردازشهای حجیم و حساس به هزینه طی هفتههای آینده در دسترس قرار خواهد گرفت.
عملکرد Sonnet 5.5 در آزمونهای تخصصی برنامهنویسی بهبود چشمگیری را ثبت کرده است. مدل جدید در بنچمارک Terminal-Bench 4.0 که تواناییهای عاملمحور در محیط ترمینال را میسنجد، به امتیاز ۷۰٫۶ درصد دست یافت؛ عددی که در مقایسه با امتیاز ۱۰٫۳ درصدی نسل پیشین یک جهش کامل محسوب میشود.
همچنین در آزمون CursorBench که بر اساس نشستهای واقعی کدنویسی در محیط Cursor طراحی شده، بهترین امتیاز ثبتشده با مدل پرچمدار Opus 5.5 تنها حدود دو امتیاز فاصله دارد. در ارزیابی FrontierCode با سطح تلاش بالا، امتیاز به دست آمده ۱۰ واحد فراتر از Sonnet 5 بود، آن هم با هزینهای معادل یکپانزدهم پردازش قبلی.
برنامهنویسان در آزمایشهای اولیه متوجه شدند که مدل تازه با درک سریعتر ساختار پایگاه کد و تجمیع هوشمندانهی فراخوانی ابزارها، تعداد مراحل اجرای دستور و در نتیجه هزینهها را به حداقل میرساند. علاوه بر برنامهنویسی، شاخص GDPval-AA که عملکرد مدلها را در ۴۴ شغل و ۹ صنعت بزرگ ارزیابی میکند، توانایی Sonnet 5.5 را نزدیک به Opus 5.5 و حدود ۴۰۰ امتیاز بالاتر از Sonnet 5 نشان میدهد.
از سوی دیگر، این پردازشگر متنی و بصری نخستین مدل از سری خود به حساب میآید که بازی Pokémon Red را صرفا بر اساس تحلیل تصاویر اسکرینشات با موفقیت به پایان رساند و در تحلیل کارهای بلندمدت فراتر از GPT-6 Sol عمل کرد.
سرعت بالاتر و ساختار قیمتگذاری
سرعت تولید خروجی در Sonnet 5.5 بیش از ۳۰ درصد سریعتر از مدل گذشته گزارش شده و به دلیل نیاز به تعداد توکنهای کمتر برای به سرانجام رساندن هر درخواست، استفاده از آن صرفهی اقتصادی قابل توجهی دارد.
توسعهدهندگان میتوانند میزان تلاش و زمان تفکر مدل را بر اساس نیاز خود تنظیم کنند؛ تنظیمات پایینتر برای امور روتین به کار میرود و تنظیمات بالاتر به مدل اجازه میدهد با استدلال عمیقتر، خروجی را پیش از نمایش بازبینی کند.
جدول زیر مقایسهی نرخ پردازش هر یک میلیون توکن را میان مدلهای جدید نشان میدهد.
نوع توکن بر اساس یک میلیون | Claude Sonnet 5.5 | Claude Opus 5.5 |
|---|---|---|
خوانش از کش (Cache reads) | $0.20 | $0.20 |
نوشتن در کش (Cache writes) | $2.50 | $5 |
توکن ورودی (Input tokens) | $2 | $4 |
توکن خروجی (Output tokens) | $10 | $20 |
ممیزیِ رفتاری خودکار آنتروپیک در قالب حدود ۱٬۸۵۰ سناریوی مختلف نشان میدهد Sonnet 5.5 از نظر صداقت، مقاومت در برابر سوءاستفاده و همترازی با اهداف کاربر در سطح بسیار بالایی قرار دارد.
به دلیل ارتقای توان سایبری مدل تا سطحی نزدیک به Opus 5، قابلیتهای حفاظتی ویژهای به آن اضافه شده است. چنانچه درخواستی دارای ریسک سایبری بالا ارزیابی شود، پردازش بهصورت خودکار به Sonnet 5 ارجاع داده خواهد شد، هرچند کدنویسی و رفع باگهای روزمرهی نرمافزاری با محدودیتی مواجه نمیشود. متخصصان امنیت میتوانند برای دسترسی به قابلیتهای پیشرفتهتر از طریق برنامهی تأیید سایبری اقدام کنند.




تمهیدات ایمنی زیستی نیز مشابه نسل قبل حفظ شده تا از خطرات بالقوه جلوگیری شود. افزون بر این، برای جلوگیری از حملات تقطیر داده که طی آن مهاجمان با حسابهای متعدد تلاش میکنند خروجی مدلهای قدرتمند را استخراج و شبیهسازی کنند، طبقهبندیکنندههای ایمنی جدیدی مستقر شدهاند که تفکر حفظشدهی مدل را به همان حساب کاربری اولیه متصل نگه میدارند.
به نظر شما کاهش هزینه و ارتقای چشمگیر هوش کدنویسی در مدلهای جدید چقدر فرآیند توسعه نرمافزار را دگرگون خواهد کرد؟