آنتروپیک مقاله‌ی پژوهشی جدیدی منتشر کرد که یکی از واضح‌ترین پیش‌نمایش‌ها از فرایند «خودبه‌سازی بازگشتی» در سامانه‌های هوش مصنوعی را به‌نمایش می‌گذارد.

در آزمایش‌های انجام‌شده، مدل Claude وظیفه‌ی بهبود هم‌ترازی سایر مدل‌ها را بر عهده گرفت و تمامی مراحل از بررسی متون علمی و ارائه‌ی راهکار تا تولید داده‌های آموزشی، آموزش مدل‌ها، ارزیابی نتایج و تکرار فرایند را مستقل پیش برد.

نمودار بهبود ایمنی مدل‌های هوش مصنوعی در طول ساعت‌های تحقیق خودکار
نمودار مقایسه شکاف ایمنی بسته شده توسط محققان خودکار و انسانی

پژوهشگران می‌گویند سامانه‌ی هوش مصنوعی موفق شد هر ۱۰ نقص هم‌ترازی آزموده‌شده را بدون کاهش قابلیت‌های عمومیِ سنجیده‌شده برطرف کند. در یکی از بخش‌های این آزمایش، مدل ضعیف‌ترِ Sonnet 5 برای آموزش نسخه‌ی اولیه‌ی Opus 4.8 به کار گرفته شد و توانست هم‌ترازی آن را ظرف ۶۰ ساعت به سطح مدل نهاییِ عرضه‌شده نزدیک کند.

Anthropic

فرایند کنونی گرچه هنوز به معنای خودبه‌سازی بازگشتی کامل نیست و مدلِ ارتقایافته بلافاصله در نقش پژوهشگر بعدی قرار نگرفته، اما بخش عمده‌ی این چرخه‌ی پژوهش، آموزش، ارزیابی و تکرار هم‌اکنون به دست هوش مصنوعی شکل گرفته است.