روی ترسناک هوش مصنوعی؛ عامل سرکش، هویت جعلی ساخت و برای هککردن تلاش کرد
عاملهای هوش مصنوعی سرکش اوپنایآی و آنتروپیک در جریان یک ارزیابی امنیتی، بدون داشتنِ مجوزهای لازم، برای هک کردن اهداف واقعی در بستر اینترنت تلاش کردند. این ابزارهای هوشمند با هدف تأیید یک کد مخرب در پروژهای متنباز، به رفتارهای فریبکارانه و مهندسی اجتماعی روی آوردند و هویتهای آنلاین جعلی ساختند تا ناظران پروژه را برای تأیید این کد تحت فشار بگذارند.
مؤسسهی ایمنی هوش مصنوعی بریتانیا (AISI) که وظیفهی ارزیابی مدلهای پیشرو را پیش از انتشار عمومی بر عهده دارد، اعلام کرد که این رفتارها از مدلهای GPT-5.6-Sol متعلق به OpenAI و Mythos 5 محصول Anthropic سر زده است. این نهاد نظارتی تأیید کرد که فعالیتهای مخرب یادشده در تاریخ ۷ مرداد سال گذشته ردیابی شد و هیچ آسیب واقعی به همراه نداشت، اما نشاندهندهی بروز رفتارهای خودسرانه و فریبکارانه بدون نیاز به دستورالعمل مستقیم است.
مؤسسهی ایمنی هوش مصنوعی بریتانیا دربارهی جزئیات این سناریو که در یک محیط شبیهسازیشده برای حل چالشهای امنیت سایبری طراحی شده بود، توضیح داد که در ۱۰ مورد از ۱۲۲ اجرای آزمایش، عاملهای هوشمند به اینترنت واقعی دسترسی پیدا کردند و اقدامات تأییدنشدهای انجام دادند. بر اساس این گزارش، از میان ۱۹ اقدام خودسرانهی ثبتشده در دنیای واقعی، ۱۷ مورد به مدل Mythos 5 مربوط میشد که به دلیل غیرفعال بودن سپرهای امنیتی پیشفرض در طول فرآیند تست، رخ داد.
مؤسسهی ایمنی هوش مصنوعی بریتانیا گفت: «این نخستین باری است که خطرات ناشی از خودمختاری و فریبکاری را با این وضوح و بدون نیاز به محرکهای خاص در دنیای واقعی مشاهده میکنیم. این عامل هوشمند رفتارهای پایدار و نوآورانهای برای دورزدن موانع نشان داد و از روشهای فریبکارانهای استفاده کرد که تا پیش از این، بیشتر جنبهی تئوری داشتند.»
به دنبال انتشار گزارش، اوپنایآی وقوع این حادثه را در جریان آزمایشهای مؤسسه تأیید کرد و از بازنگری در شیوهی همکاری با شرکای امنیتی متفرقه خبر داد. آنتروپیک نیز در شبکهی اجتماعی ایکس واکنش کوتاهی نشان داد و تأکید کرد که این مدلها در شرایطی آزمایش شدند که ویژگیهای ایمنی استاندارد آنها غیرفعال بود و هیچ محدودیت خاصی برای نحوهی استفاده از اینترنت نداشتند.