اوپنایآی در آستانهی انتشار Astra، قدرتمندترین مدل هوش مصنوعی خود تا امروز، با موجی از نگرانیهای امنیتی روبهرو شده است. دلیل این دغدغهها فقط تواناییهای تازهی مدل نیست، بلکه نحوهی پنهانسازی فرایند تصمیمگیری آن است؛ مسیری که میتواند نظارت بر رفتارهای نامطلوب را دشوارتر کند.
اوپنایآی روز سهشنبه اعلام کرد عرضهی Astra را عقب انداخته تا روی مشکلات ایمنی کار کند؛ کمی بعد، گزارش جدید وبسایت اینفورمیشن بحثها را شعلهور کرد، چون گزارش ادعا میکرد Astra نسبت به دیگر مدلهای پیشرو، «فکر کردن» خود را بسیار کمتر نشان میدهد. همین نکته برای پژوهشگران زنگ خطر بود، زیرا مدلهای مبتنی بر زنجیرهی استدلال، به ناظران اجازه میدهند مسیر رسیدن مدل به پاسخ را دنبال کنند و پیش از اجرای رفتارهای نامطلوب، نشانههای هشدار را ببینند.
در معماری متداولترِ ترنسفورمر، اطلاعات لایهبهلایه پردازش میشود و در برخی مدلها امکان آشکار شدن استدلال میانی وجود دارد. اما گزارش اینفورمیشن، با استناد به فردی آشنا با توسعهی مدل منتشرنشده، میگوید Astra از رویکردی مبهمتر به نام «پردازش بازگشتی در عمق مدل» یا «ترنسفورمر با حلقههای پردازشی» استفاده میکند؛ شیوهای که اطلاعات را در چرخههای داخلی میچرخاند و خروجی نهایی را با ردپای زبانیِ بسیار کموضوحتری تولید میکند. نتیجه روشن است: عملکرد مدل ممکن است بهتر شود، اما تشخیص تهدیدها و رفتارهای ناخواسته سختتر میشود.
«بدترین تحول در امنیت هوش مصنوعی تا امروز»
به گفتهی همان منبع ناشناس، اوپنایآی استفاده از این روش را در Astra محدود کرده تا پژوهشگران همچنان بتوانند استدلال مدل را زیر نظر بگیرند. با این حال، ابهام دربارهی پایهی فنی مدل باقی ماند.
اوپنایآی میگوید که Astra را با «نظارت اضافی بر زنجیرهی استدلال» عرضه میکند تا «اقدامهای بالقوهی ناهماهنگ» را سریع شناسایی و مهار کند؛ اما توضیح نداد که آیا Astra بر معماری متفاوتی بنا شده یا نه.
واکنشها در شبکههای اجتماعی خیلی زود شکل گرفت. رایان گرینبلات، دانشمند ارشد Redwood Research و یکی از سه پژوهشگر خارجی که اوپنایآی برای بررسی هک هاگینگ فیس به کار گرفت، نوشت که تصمیم برای استفاده از معماری مبهمتر در Astra «ممکن است بدترین تحول در امنیت هوش مصنوعی تا امروز» باشد. نگرانی اصلی او به تجربهی بررسی رخداد هاگینگ فیس برمیگردد؛ جایی که تیم تحقیق برای فهمیدن رفتار مدلها بهشدت به زنجیرهی استدلال آنها متکی بود. هرچه این مسیر قابلرؤیتتر باشد، شناسایی استراتژیهای پنهان یا گمراهکننده سادهتر میشود.
گرینبلات و دیگر متخصصان امنیت میگویند رقابت برای ساخت مدلهای پیشرفتهتر میتواند صنعت را به سمت «مسابقهای به سوی پایینترین سطح شفافیت» سوق دهد؛ مسابقهای که در آن سازندگان برای جلو زدن از رقبا، معماریهایی را برمیگزینند که نظارت بر آنها دشوارتر است. او همچنین از برداشت خود از پیامهای اوپنایآی گفت و نوشت که به نظرش شرکت «قصد دارد برای امنیت، بهطور بسیار شدید به نظارت بر زنجیرهی استدلال تکیه کند.»
مدیران و پژوهشگران اوپنایآی نیز در چند پست شبکههای اجتماعی به انتقادها پاسخ دادند، بیآنکه بهطور مستقیم استفاده از این تکنیک را رد کنند. میکا کارول، تومِک کورباک، دین بال و جیکوب پاچوکی هر کدام دربارهی خطر «هوش مصنوعیِ غیرقابلنظارت» یا رقابت بر سر شفافیت کمتر هشدار دادند.
پاچوکی نوشت که ترس از «مسابقه بهسوی غیرقابلنظارتشدن» بر اثر گزارشهای گیجکننده شکل گرفته است. او همچنین توضیح داد که عمق محاسبات Astra، یعنی تعداد گامهایی که مدل میتواند در درون خود انجام دهد، «در محدودهای حدود دو برابر GPT-4» قرار دارد؛ نشانهای که اگر از تکنیک مبهمتر استفاده شده باشد، شاید میزان افزایش ابهام کمتر از برداشتهای اولیه باشد.
پاچوکی در ادامه تأکید کرد که اوپنایآی «از همان ابتدای ظهور مدلهای استدلالی» برای حفظ و بهرهگیری از نظارت بر زنجیرهی استدلال تلاش کرده است. با این حال، او هشدار داد که این نوع نظارت شکننده شده و متاسفانه رو به تضعیف میرود؛ روندی که به گفتهی او تنها به تغییر معماری وابسته نیست و قرار است دربارهاش بهزودی توضیح بیشتری منتشر شود.
مسئلهی اصلی فراتر از Astra باقی میماند. اگر مدلهای پیشرفتهتر برای رسیدن به توانایی بالاتر، لایههای بیشتری از تصمیمگیری را از دید پژوهشگران پنهان کنند، صنعت هوش مصنوعی با چالشی بنیادی روبهرو میشود؛ چالشی میان قدرت بیشتر و قابلیت نظارت کمتر.
شما کدام را مهمتر میدانید، قدرت بیشتر یا نظارتپذیری بالاتر؟