بیانیه عجیب اوپنایای: هوش مصنوعی ما ناخواسته یک پلتفرم بزرگ را هک کرد!
مدلهای هوش مصنوعی شرکت اوپنایآی بهطور غیرمنتظره در حین یک ارزیابی امنیتی داخلی، از محیط ایزولهی تست خارج شدند و به پلتفرم Hugging Face دسترسی پیدا کردند. اتفاقی که اوپنایآی از آن بهعنوان یک نفوذ تصادفی یاد میکند، پرسشهای تازهای دربارهی رفتارهای پیشبینینشدهی مدلهای پیشرفته ایجاد کرده است.
اوپنایآی اعلام کرد مدل GPT-5.6 Sol و یک مدل قدرتمندتر دیگر که هنوز منتشر نشده است، در محیط سندباکس خود آسیبپذیریهایی کشف کردند. این مدلها با سوءاستفاده از یک آسیبپذیری روز صفر به اینترنت دسترسی پیدا کردند و سپس Hugging Face را هدف قرار دادند.
پلتفرم Hugging Face حدودا یک هفته پیش یک حادثهی امنیتی را فاش و اعلام کرد که حمله توسط «یک عامل هوش مصنوعی خودمختار» هدایت شده است. عاملهای هوش مصنوعی Hugging Face این نفوذ را شناسایی و متوقف کردند.
اوپنایآی اکنون پذیرفته که هک Hugging Face در جریان ارزیابی تواناییهای امنیت سایبری مدلهایش رخ داده است. این شرکت میگوید تمام شواهد نشان میدهد که مدلها بهشدت بر یافتن راهحلی برای ExploitGym، یک سامانه برای سنجش توانایی مدلهای هوش مصنوعی در تبدیل آسیبپذیریهای امنیتی به اکسپلویت، متمرکز بودهاند.
اوپنایآی در توضیح این رویداد نوشت که مدلهایش استنتاج کردند Hugging Face احتمالا میزبان مدلها، مجموعهدادهها و راهحلهایی برای ExploitGym است و سپس بهدنبال راههایی برای دسترسی به اطلاعات محرمانه گشتند تا در ارزیابی تقلب کنند. در بخشی از این گزارش آمده است: «در یک نمونه، هوش مصنوعی چندین بردارِ حمله را بههم زنجیر کرد، از جمله استفاده از اطلاعات کاربری دزدیدهشده و آسیبپذیریهای روز صفر برای یافتن یک مسیر اجرای کد از راه دور روی سرورهای Hugging Face.»
با وجود جدی بودن این حادثه، نحوهی اطلاعرسانی اوپنایآی بیشتر به یک تبلیغ برای تواناییهای فناوریاش شباهت دارد. این شرکت میگوید GPT-5.6 Sol در حفظ عملیاتهای سایبری چندمرحلهای بهتر عمل میکند و همچنین مشتریان سازمانی را تشویق کرده تا برای دسترسی به مدل امنیتی «سایبر» ثبتنام کنند.
اوپنایآی در پایان اعلام کرد که هماکنون با Hugging Face برای بررسی این حادثهی امنیتی همکاری میکند و سیستمهای حفاظتی جدیدی را در محیط تحقیقاتی خود پیادهسازی خواهد کرد.