هوش مصنوعی کلاد ناخواسته به زیرساخت‌های سه سازمان نفوذ کرد

جمعه 9 مرداد 1405 - 11:27
مطالعه 3 دقیقه
لوگو کلاد / Claude روی گوشی هوشمند
هوش مصنوعی کلاد در جریان چالش‌های شبیه‌سازی‌شده‌ی هک، به زیرساخت‌های سه سازمان نفوذ کرد.

آنتروپیک با انتشار بیانیه‌ای اعلام کرد که مدل‌های هوش مصنوعی کلاد در جریان ارزیابی‌های امنیتی، از محیط‌های شبیه‌سازی‌شده خارج شدند و به سیستم‌های واقعی سه سازمان مختلف نفوذ غیرمجاز کردند. بررسی‌های گسترده روی ۱۴۱٬۰۰۶ نوبت اجرای آزمایشی نشان داد این مدل‌ها به دلیل خطاهای فنی به اینترنت آزاد دسترسی داشته‌اند.

نفوذ در جریان چالش‌های موسوم به «تسخیر پرچم» رخ داده است. در این آزمون‌ها، به هوش مصنوعی سناریویی فرضی داده می‌شود تا یک سیستم شبیه‌سازی‌شده را هک کند. با این حال، به دلیل ناهماهنگی میان آنتروپیک و شریک ارزیابی آن با نام Irregular، دسترسی به اینترنت برای مدل‌ها باز مانده بود.

سه مدل مختلف شامل Claude Opus 4.7، میتوس ۵ و یک مدل تحقیقاتی داخلی در این حوادث نقش داشته‌اند. مدل‌ها بدون ابزارهای نظارتی و فیلترهای ایمنی معمول که برای نسخه‌های عمومی فعال می‌شوند، مورد آزمایش قرار گرفته بودند.

در نخستین حادثه، مدل کلاد اوپوس ۴٫۷ نام یک شرکت فرضی در سناریو را با یک دامنه‌ی واقعی در اینترنت مطابقت داد. این مدل با فرض اینکه سیستم هدف بخشی از آزمون است، به زیرساخت‌های آن شرکت حمله کرد و موفق شد اطلاعات کاربری و دیتابیس حاوی صدها ردیف داده‌ی واقعی را استخراج کند. این مدل حتی پس از اینکه متوجه واقعی‌بودن محیط شد، به حمله‌ی خود ادامه داد.

در حادثه‌ی دوم، مدل میتوس ۵ تلاش کرد یک بسته‌ی پایتون مخرب را در مخزن عمومی PyPI بارگذاری کند. این مدل برای دورزدن موانع، یک حساب کاربری رایگان ساخت و بدافزار خود را آپلود کرد که به مدت یک ساعت در دسترس عموم قرار گرفت. این بسته روی ۱۵ سیستم واقعی دانلود شد و کلاد توانست اطلاعات کاربری یکی از شرکت‌های امنیتی را که سیستم‌هایش این بسته را اسکن کرده بودند، سرقت کند.

در سومین مورد، مدل تحقیقاتی داخلی آنتروپیک پس از ناکامی در دسترسی به هدف فرضی، حدود ۹ هزار هدف را در اینترنت اسکن کرد. این مدل با استفاده از روش‌های ساده مانند تزریق SQL به یک اپ متصل به اینترنت نفوذ کرد؛ اما پس از متوجه‌شدن واقعی‌بودن سیستم، عملیات را متوقف کرد.

آنتروپیک می‌گوید: «محیط‌های ارزیابی که شامل قابلیت‌های خودگردان قدرتمند هستند، به کنترل‌های شدیدی نیاز دارند. تست‌های ایمنی پیش از انتشار مدل انجام می‌شوند؛ چون ما هنوز به‌طور کامل از توانایی آن‌ها آگاه نیستیم. محیط‌های ارزیابی باید به همان اندازه‌ی سیستم‌های اصلی ایمن‌سازی شوند.»

آنتروپیک می‌گوید پس از افشای فرار مدل‌های OpenAI از محیط ایزوله، بررسی‌های خود را آغاز و بلافاصله تمام ارزیابی‌های سایبری را متوقف کرد. آنتروپیک اکنون در حال همکاری با سازمان‌های آسیب‌دیده برای رفع مشکلات امنیتی است و قصد دارد با همکاری سازمان مستقل METR، بررسی‌های مستقل را روی این پرونده انجام دهد.

نظرات

از دیگر اعضاء خانواده قلم