پژوهشگران امنیتی راهی برای خواندن «افکار درونی» رمزگذاری‌شده‌ی تمامی مدل‌های استدلالی بزرگ هوش مصنوعی پیدا کرده‌اند. این آسیب‌پذیری بزرگ به فاش شدن ۶۲ کلید فعال API و ۳۳ رمز عبور در گزارش‌های عمومی چت‌هایی منجر شده است که توسعه‌دهندگان بدون آگاهی از محتوای پنهان، آن‌ها را در اینترنت به اشتراک گذاشته بودند.

تیمی از محققان مؤسسه‌ی پژوهشی MATS، مؤسسه‌ی اِلیس توبینگن، مؤسسه‌ی سیستم‌های هوشمند ماکس پلانک و شرکت امنیتی Snyk این آسیب‌پذیری را در مدل‌های استدلالی شناسایی کرده‌اند. این مدل‌ها پیش از ارائه‌ی پاسخ نهایی، گام‌های حل مسئله را در یک فضای پیش‌نویس داخلی پردازش می‌کنند که معمولا از دید کاربر پنهان و رمزگذاری می‌شود.

محققان در مقاله‌ی خود نوشتند: «ما با رمزگشایی از ۳۱۵,۳۲۰ بلوک استدلالی استخراج‌شده از مخازن عمومی، ۳۶۷ داده‌ی هویتی حساس و ۱۸۲ اعتبارنامه‌ی امنیتی را بازیابی کردیم.»

این نقص امنیتی به ساختار سیستم بازمی‌گردد؛ چرا که شرکت‌های گوگل، اوپن‌ای‌آی و آنتروپیک به جای استفاده از کلیدهای اختصاصی برای هر کاربر یا چت، از یک کلید رمزگذاری واحد و همگانی در سراسر اکوسیستم خود استفاده می‌کنند.

یکپارچگی کلیدها به این معنی است که یک بلوک استدلالی رمزگذاری‌شده از مدل قدرتمند Claude Opus 4.8 بدون مشکل به مدل ارزان‌تر و کم‌حفاظت‌تر Claude Haiku 4.5 منتقل می‌شود. از آنجا که مدل ضعیف‌تر فاقد آموزش‌های امنیتی پیشرفته برای خودداری از افشای فرآیند تفکر است، با یک دستور ساده تمام متن پنهان را به صورت واضح بازگو می‌کند.

الکساندر پافیلوف، پژوهشگر ارشد این پروژه، در شبکه‌ی اجتماعی ایکس نوشت: «قابلیت انتقال میان‌مدلی به این معنی است که Haiku 4.5 می‌تواند افکار Opus 4.8 را بخواند.»

این روش روی خانواده‌ی GPT-5.6 و مدل‌های جمنای گوگل نیز با موفقیت آزمایش شد. هر سه شرکت پس از دریافت گزارش‌های امنیتی، وصله‌های نرم‌افزاری را در سمت سرور اعمال کردند، اما گزارش‌های قدیمی که پیش‌تر در پلتفرم‌هایی مانند گیت‌هاب منتشر شده‌اند، همچنان قابل رمزگشایی هستند.