هوش مصنوعی کلاد ناخواسته به زیرساختهای سه سازمان نفوذ کرد
آنتروپیک با انتشار بیانیهای اعلام کرد که مدلهای هوش مصنوعی کلاد در جریان ارزیابیهای امنیتی، از محیطهای شبیهسازیشده خارج شدند و به سیستمهای واقعی سه سازمان مختلف نفوذ غیرمجاز کردند. بررسیهای گسترده روی ۱۴۱٬۰۰۶ نوبت اجرای آزمایشی نشان داد این مدلها به دلیل خطاهای فنی به اینترنت آزاد دسترسی داشتهاند.
نفوذ در جریان چالشهای موسوم به «تسخیر پرچم» رخ داده است. در این آزمونها، به هوش مصنوعی سناریویی فرضی داده میشود تا یک سیستم شبیهسازیشده را هک کند. با این حال، به دلیل ناهماهنگی میان آنتروپیک و شریک ارزیابی آن با نام Irregular، دسترسی به اینترنت برای مدلها باز مانده بود.
سه مدل مختلف شامل Claude Opus 4.7، میتوس ۵ و یک مدل تحقیقاتی داخلی در این حوادث نقش داشتهاند. مدلها بدون ابزارهای نظارتی و فیلترهای ایمنی معمول که برای نسخههای عمومی فعال میشوند، مورد آزمایش قرار گرفته بودند.
در نخستین حادثه، مدل کلاد اوپوس ۴٫۷ نام یک شرکت فرضی در سناریو را با یک دامنهی واقعی در اینترنت مطابقت داد. این مدل با فرض اینکه سیستم هدف بخشی از آزمون است، به زیرساختهای آن شرکت حمله کرد و موفق شد اطلاعات کاربری و دیتابیس حاوی صدها ردیف دادهی واقعی را استخراج کند. این مدل حتی پس از اینکه متوجه واقعیبودن محیط شد، به حملهی خود ادامه داد.
در حادثهی دوم، مدل میتوس ۵ تلاش کرد یک بستهی پایتون مخرب را در مخزن عمومی PyPI بارگذاری کند. این مدل برای دورزدن موانع، یک حساب کاربری رایگان ساخت و بدافزار خود را آپلود کرد که به مدت یک ساعت در دسترس عموم قرار گرفت. این بسته روی ۱۵ سیستم واقعی دانلود شد و کلاد توانست اطلاعات کاربری یکی از شرکتهای امنیتی را که سیستمهایش این بسته را اسکن کرده بودند، سرقت کند.
در سومین مورد، مدل تحقیقاتی داخلی آنتروپیک پس از ناکامی در دسترسی به هدف فرضی، حدود ۹ هزار هدف را در اینترنت اسکن کرد. این مدل با استفاده از روشهای ساده مانند تزریق SQL به یک اپ متصل به اینترنت نفوذ کرد؛ اما پس از متوجهشدن واقعیبودن سیستم، عملیات را متوقف کرد.
آنتروپیک میگوید: «محیطهای ارزیابی که شامل قابلیتهای خودگردان قدرتمند هستند، به کنترلهای شدیدی نیاز دارند. تستهای ایمنی پیش از انتشار مدل انجام میشوند؛ چون ما هنوز بهطور کامل از توانایی آنها آگاه نیستیم. محیطهای ارزیابی باید به همان اندازهی سیستمهای اصلی ایمنسازی شوند.»
آنتروپیک میگوید پس از افشای فرار مدلهای OpenAI از محیط ایزوله، بررسیهای خود را آغاز و بلافاصله تمام ارزیابیهای سایبری را متوقف کرد. آنتروپیک اکنون در حال همکاری با سازمانهای آسیبدیده برای رفع مشکلات امنیتی است و قصد دارد با همکاری سازمان مستقل METR، بررسیهای مستقل را روی این پرونده انجام دهد.