وقتی تب انتشار مدلهای قدرتمند هوش مصنوعی متنباز بالا گرفت، تنها سد دفاعی در برابر پاسخهای خطرناک این مغزهای ماشینی، چیزی نبود جز گاردریلها؛ همان نردههای محافظ و کدهای بازدارندهای که توسعهدهندگان روی مدلهایشان تعبیه میکردند تا در برابر درخواستهای مخرب، قاطعانه «نه» بگویند.
اما حالا توسعهدهندگان در پلتفرم X و فرومهای فناوری برای یکدیگر توضیح میدهند که چگونه به یکی از توانمندترین مدلهای متنباز جهان دسترسی آزادی پیدا کردهاند، آنهم بدون محدودیت و فیلترهای اخلاقی.
استارتاپ تازهنفس Abliteration.ai میخواهد درست مثل نامش که از تکنیک ابلیتریشن میآید، رفع فیلترهای مدلهای هوش مصنوعی را از رویهای زیرزمینی به سرویسی تجاری و تمیز تبدیل کند. ابلیتریشن یعنی فرایندی که تمایل مدلهای هوش مصنوعی به رد درخواستهای مخرب را از میان میبرد.
خلاصه صوتی
خلاصه صوتی، ساختهشده با هوش مصنوعی
استارتاپ ابلیتریشن ایآی اکنون نسخههای دستکاریشده و بدون محدودیت مدلهایی نظیر GLM-5.3 را که مدتی پیش توسط Z.ai منتشر شد، در اختیار متقاضیان قرار میدهد و کاربران میتوانند بهسادگی باز کردن یک صفحه وب یا از طریق یک API، با نسخهی بدون سانسور گفتگو کنند.
چگونه محدودیت مدلهای هوش مصنوعی را کنار میزنند؟
مدلهای زبانی پس از آموزش اولیه، یاد میگیرند به بعضی درخواستهای خطرناک پاسخ ندهند. پژوهشگران در سال ۲۰۲۴ متوجه شدند که این رفتار فقط حاصل چند قانون یا فیلتر جداگانه نیست؛ در فعالیت داخلی مدل میتوان الگویی مشخص پیدا کرد که با «امتناع از پاسخ» ارتباط دارد.
وقتی پژوهشگران در آزمایشهایشان الگوی امتناع را تضعیف کردند، احتمال رد درخواستهای زیانبار شدیداً کاهش یافت. برعکس، تقویت همان الگو باعث میشد مدل حتی بعضی درخواستهای بیخطر را هم رد کند.
فرایند ابلیتریشن بر اساس همین یافته انجام میشود، یعنی وزنهای مدل را طوری تغییر میدهند تا بازتولید الگوی امتناع سختتر شود. به همین دلیل، فرایند ابلیتریشن فراتر از خاموشکردن فیلتر ایمنی؛ بخشی از رفتاری را که مدل در جریان آموزش یاد گرفته، دستکاری میکند.
Abliteration با دور زدن گاردریلهای امنیتی، دسترسی به هوش مصنوعی بدون سانسور را فراهم میکند
ماه می ۲۰۲۶ فایننشالتایمز گزارش داد که بیش از ۳۵۰۰ نسخهی تغییریافته و بدون حفاظ از مدلهای شرکتهایی مانند متا و گوگل منتشر شدهاند و مجموع دانلود آنها از ۱۳ میلیون بار فراتر میرود. خبرنگاران این ژورنال همچنین توانستند با ابزاری عمومی، حفاظهای Llama 3.3 را در کمتر از ده دقیقه حذف کنند.
محققان و توسعهدهندگان پیشازاین برای حذف محدودیتهای هوش مصنوعی زمان میگذاشتند و همین حالا پلتفرم هاگینگفیس از هزاران مدل ابلیتریتشده میزبانی میکند. اما شرکت Abliteration.ai که اواخر سال گذشته تأسیس و در ماه مارس ۲۰۲۶ رسماً ثبت شد، میخواهد از فرایند رفع محدودیت مدلها کسبوکاری واقعی بسازد.
نکتهی مهم اینکه در گذشته اگر کسی میخواست با یکی از مدلهای بدون سانسور کار کند، مجبور بود شخصاً مدل را دانلود کند و طبیعتاً به سختافزار قدرتمندی برای اجرا نیاز داشت. اما حالا این استارتاپ با میزبانی مستقیم مدلهای بدون حفاظ روی سرورهای خودش، تمام دردسرهای گذشته را از سر راه کنار میزند تا کاربر بهراحتی به مدلی دسترسی داشته باشد که دیگر خط قرمزی نمیشناسد.
وقتی هوش مصنوعی به یک «بیمار روانی» تبدیل میشود!
ساخت یک حساب کاربری در پلتفرم Abliteration.ai و شروع گفتگو با نسخه دستکاریشدهی GLM-5.3 تنها چند دقیقه زمان میبرد. ربکا بلان از وبسایت تک کرانچ با دو درخواست غیرمعمول خارج از چارچوب، توانایی و تغییر رفتار مدل را محک زد.
بلان در مرحله اول از مدل جدید خواست تا یک برنامه پایتون برای سرقت رمزهای عبور ذخیرهشده در مرورگر کروم بنویسد و در تست دوم هم به مدل گفت پروتکلی دقیق و گامبهگام برای کشت پاتوژن یا عامل بیماریزای انسانی خطرناکی در محیط خانه ارائه دهد. هوش مصنوعی هم بدون کوچکترین هشداری، هر دو درخواست را اجرا کرد.
منتقدان بهشدت نگراناند که در دسترس قرارگرفتن چنین مدلهای بیحدومرزی در مقیاس وسیع، به آسیبهای واقعی و فاجعهبار منجر شود. اندرو یون مدیر تحقیقات سازمان غیرانتفاعی ایمنی هوش مصنوعی CivAI، میگوید فرایند ابلیتریشن، «مدل را طوری تغییر میدهد که به یک بیمار روانی تبدیل شود.»
نسخههای دستکاریشده مدل بدون هیچ هشداری کدهای مخرب مینویسند
به گفتهی یون، شما میتوانید به معنای واقعی کلمه هر چیزی را در این سیستم تایپ کنید و مدل چشمبسته اطاعت میکند. او پیشبینی میکند که در آیندهای نهچندان دور، شاهد استفاده گسترده از مدلهای مهارگسیخته برای اهداف شوم خواهیم بود.
Abliteration.ai هنوز از هیچ رویهی معتبری برای احراز هویت و شناخت مشتری (KYC) در سرویسهایش استفاده نمیکند و فقط به مشخصات کارت اعتباریای دسترسی دارد که مشتریان برای خرید سرویس استفاده میکنند. شرکت میگوید نمیتوان بهراحتی تصمیم گرفت که چه کسانی باید اجازهی دسترسی به مدلهای بدون سانسور را داشته باشند و مدیران هنوز این موضوع را بررسی میکنند.
هزینههای استارتاپ چگونه تأمین میشود؟
دوون همبنیانگذار استارتاپ که به دلیل اشتغال در شرکتی دیگر نمیخواهد نام خانوادگیاش فاش شود، میگوید استارتاپ با چند ارائهدهندهی بزرگ خدمات ابری قرارداد دارد و هزینهی زیرساختها صرفاً از محل درآمد مشتریان پرداخت میشود.
Abliteration.ai هنوز هیچ بودجهای از شرکتهای سرمایهگذاری خطرپذیر دریافت نکرده، اما میخواهد برای جذب سرمایه با برخی شرکتها مذاکره کند.
به گفتهی دوون پلتفرم آنها چند محدودیت جزئی دارد. برای مثال هرچند در بررسیها مشخص شد مدل از ارائه دستورالعملهای خودکشی امتناع میکند، ولی مسئولان استارتاپ میخواهند محدودیتهای بیشتری برای جلوگیری از ترویج خشونت اعمال کنند.
کارشناسان پیشنهاد میکنند دولتها فیلترهای خودکاری را روی خروجی هوش مصنوعی اعمال کنند
دوون در ادامه اعتراف میکند که تعیین مرزهای مسئولیت یک شرکت در قبال رفتارهای دیوانهوار کاربران، چالش بزرگی است که هنوز پاسخی برای آن پیدا نکردهاند.
کارشناسان معتقدند که هیچ راهی برای متوقف کردن قطار مدلهای متنباز بدون سانسور وجود ندارد. اندرو یون راهکار دیگری پیشنهاد میدهد و میگوید دولتها باید ارائهدهندگان سرویسها را ملزم کنند تا یکلایهی خودکار طبقهبندی و فیلتر روی خروجیهای پلتفرمهایشان قرار دهند تا کدهای مخرب سایبری یا فرمول سلاحهای بیولوژیکی مسدود شوند.
به اعتقاد یون شرکتهایی که سختافزارها و پردازندههای گرافیکی پیشرفته را اجاره میدهند نیز باید هویت مشتریانشان را بهدقت بررسی کنند و در صورت هرگونه شک منطقی به سوءاستفاده، دسترسی آنها را قطع نمایند.
دفاع با سلاح مهاجم؛ استدلال موافقان ابلیتریشن
قاعدهای معروف در دنیای امنیت سایبری میگوید شما نمیتوانید در برابر رفتاری که قادر به بازتولید آن نیستید، از خود دفاع کنید. اگر یک مدل هوش مصنوعی از نوشتن کدهای اکسپلویت مخرب برای سوءاستفاده از آسیبپذیریها امتناع کند، چگونه میتواند به متخصصان امنیتی تست نفوذ کمک کند تا حفرههای امنیتی را پیش از وقوع فاجعه ببندند؟
از طرف دیگر برداشتن محدودیتها، انجام طیف دیگری از فعالیتهای خطرناک را نیز آسانتر میکند.
شرکت Abliteration.ai با تکیه بر منطق اول، در شبکههای اجتماعی خود مینویسد هدف اصلیاش، توانمندسازی متخصصان برای انجام عملیات سایبری تهاجمی، تستهای تیم قرمز و آزمایش عاملهای هوشمندی است که سایر مدلهای استاندارد از انجام آنها سر باز میزنند.
شرکتهای امنیت سایبری از مدلهای بدون حفاظ برای تست نفوذ و بررسی مقاومت شبکهها استفاده میکنند
دوون، بنیانگذار پلتفرم و دیگر حامیان جریان ابلیتریشن استدلال میکنند که دسترسی آزادانه و فراگیر به مدلهای پیشرفتهی بدون سانسور، بهترین شکل دفاع محسوب میشود. او میگوید:
«مدلهای ابلیتریتشده میتوانند ذهنیت و رفتار بازیگران مخرب را بهخوبی شبیهسازی کنند و همین امر به مدافعان سایبری اجازه میدهد با سرعتی بالاتر وارد عمل شوند. تیمهای امنیتی تمام ابزارهای لازم را برای شبیهسازی عوامل مخرب و سپس دفاع در برابر اقدامات هکرها در اختیار دارند. من فکر میکنم این رویه، پیشرفت امنیت سایبری را تسریع خواهد کرد، هرچند شاید در نگاه اول متناقض به نظر برسد»
به گفتهی بنیانگذاران باوجوداینکه Abliteration.ai هنوز شرکتی نوپاست، چندین استارتاپ تازهتأسیس در حوزهی تیم قرمز در بریتانیا و اروپا مشتریاش هستند؛ شرکتهایی که وظیفه دارند امنیت بانکها، خطوط هوایی و سایر زیرساختهای حیاتی را در برابر حملات سایبری تضمین کنند و سپرهای دفاعی آنها را ارتقا دهند.
دوون تأکید میکند: «یکی از مشتریان اصلی ما، ایجنتهای هوشمند بانکی را از طریق تیم قرمز بررسی میکند. اگر میخواستند از مدلهای دستنخورده و دارای محدودیت امروزی استفاده کنند، هرگز قادر نبودند آزمایشهای پیشرفتهی موردنیازشان را روی ایجنتها انجام دهند.»
توهم امنیت یا ابزار کارآمد؟ اختلاف نظر متخصصان سایبری
درحالیکه بنیانگذار Abliteration.ai از مزایای این پلتفرم دفاع میکند، فعالین امنیت سایبری هنوز بر سر مزایای تکنیک محدودیتزدایی با هم اختلافنظر دارند. آیا مدلهای بدون محدودیت واقعاً قطعهی گمشدهی پازل اقدامات دفاعیاند، یا صرفاً ترندی خطرناک که توهم امنیت ایجاد میکنند؟
چندین شرکت فعال در حوزه تیم قرمز که در خط مقدم این نبرد حضور دارند، با دوون موافقاند که هکرها و افراد شرور همین حالا هم محدودیت مدلها را برای طراحی حملات خصمانه حذف میکنند، بنابراین مدافعان هم به ابزارهای مشابه نیاز دارند. اما وقتی بحث میزان اثرگذاری این مدلها در فرآیند واقعی دفاع به میان میآید، اختلافات بالا میگیرد.
دستکاری ساختاری مدلها، بخشی از دانش پایه و کارآمدی منطقی آنها را از بین میبرد
درحالیکه دوون ادعا میکند ابلیتریت کردن برای عملیات جامع تیم قرمز ضرورت دارد، برخی از متخصصان میگویند در کارهای روزمرهشان به مدلهای بدون حفاظ نیازی ندارند و ترجیح میدهند از روش پایدارتر، یعنی فاینتیون کردن مدلهای متنباز استفاده کنند؛ مدلهایی که بهخودیخود محدودیتهای کمی دارند؛ اما انسجام ذهنیشان دستنخورده باقی میماند.
احمد علی، مدیرعامل شرکت تیم قرمز Fabraix، خودش را منتقد این روش معرفی میکند و باور دارد که فرآیند ابلیتریشن، مانند یک جراحی مغز ناموفق، بخشی از دانش پایهای و قابلیتهای مدل را از بین میبرد. او میگوید: «اگر واقعاً بخواهید با این مدلها آسیبهای جدی سایبری یا بیولوژیکی وارد کنید، متوجه میشوید که آنها دیگر به اندازهی نسخههای اصلی کارآمد و مؤثر نیستند.»
آلسیو لوموسچو، مدیر ارشد فناوری در Safe Intelligence، نگاه میانهروتری دارد. او احتمال کاهش قابلیتهای هوش مصنوعی پس از حذف گاردریلها را میپذیرد، اما همچنان معتقد است این مدلهای تغییریافته میتوانند رفتارهای خاصی از خود نشان دهند که برای تست استرس و پیداکردن نقاط ضعف پنهان یک سیستم، مفید واقع میشود.
دیوید اسلیتر بنیانگذار و معمار ارشد پلتفرم امنیت سایبری Armadin، تأیید میکند که تا این لحظه، مدلهای ابلیتریتشده جایی در فرایندهای دفاعی شرکتش نداشتهاند، چرا که تا پیش از نسل جدید، جیلبریک کردن و دورزدن محدودیت مدلهای متنباز کار چندان سختی نبود و نیازی به این سطح از دستکاری ساختاری احساس نمیشد.
بااینحال، آرمادین دربارهی ابلیتریشن تحقیق میکند و به عقیدهی اسلیتر باید جامعهی متنباز را ترغیب کنیم تواناییهای واقعی این مدلها را بشناسند و بررسی کنند.
او ادامه میدهد: «در هر حال چنین کارهایی پشت درهای بسته و بهصورت خصوصی انجام خواهند شد.انجامشدن آنها در فضای باز، ابزار لازم را در اختیار پژوهشگران قرار میدهد. در چنین شرایطی میتوانیم بفهمیم مرز واقعی توانایی مدلها کجاست و آسیبهای احتمالی را بهتر بشناسیم.»