ماجرا معمولاً با یک درخواست ساده از دستیار هوش مصنوعی شروع میشود: «این یادداشت را برای جلسهی فردا ویرایش کن». درخواست کمی دوپهلوست، اما مدل اصلاً معطل نمیکند و با لحنی مطمئن و خوشبینانه متنی برای جلسهای با مدیران مینویسد.
کمی بعد، کاربر وارد عمل میشود تا ابهام را برطرف کند: «نه، جلسه با مهندسهاست. پروژه شکستخورده و باید بیتعارف و صریح دربارهی دلایلش حرف بزنیم.»
هوش مصنوعی عذرخواهی میکند، اشتباهش را میپذیرد و حتی دلایل شکست را هم به متن اضافه میکند. اما خروجی جدید، هنوز بوی جلسات هیئتمدیره میدهد! شکست به «فرصتی شیرین برای یادگیری» تبدیل میشود، جزئیات حیاتیِ فنی به حاشیه میروند و لحن متن همچنان میخواهد مخاطب را تحتتأثیر قرار دهد. مدل ظاهراً حرف کاربر را تصدیق میکند، اما اسکلتبندی متن هنوز حالوهوای برداشت اولیه را دارد.
خلاصه صوتی
خلاصه صوتی، ساختهشده با هوش مصنوعی
پژوهشگران متا با همین مثالِ آشنا، رفتاری را توضیح میدهند که اغلب کاربران حرفهای هوش مصنوعی بارها تجربهاش کردهاند. مدل عذر میخواهد، میگوید «حق با شماست» و حتی خطایش را درست توضیح میدهد. اما در نهایت ردپای برداشت اشتباه اولیه، شاید کمی پنهانتر در پاسخ دیده میشود.
لجبازی مدلهای هوش مصنوعی را همیشه در فرم مخالفت آشکار نمیبینیم، گاهی آن را پشت موافقتی مؤدبانه تجربه میکنیم.
اینرسی باور؛ وقتی هوش مصنوعی اسیر پیشفرضهای کهنه میشود
پژوهشگران اصرار پنهان مدلها بر اشتباهشان را با تعبیرهایی مثل سختی استدلال و اینرسی باور توصیف میکنند. اینرسی باور یعنی اطلاعات جدیدی به مدل میرسد، اما برداشت قبلی هنوز روی جواب یا تصمیم بعدی سنگینی میکند.
رسیدن اطلاعات جدید به مدل همیشه به معنای اصلاح مسیر نیست.
وقتی از لجبازی حرف میزنیم، منظورمان قصد، غرور یا شخصیتی انسانی در مدل نیست. این اصطلاح را برای الگویی سنجشپذیر به کار میبریم؛ زیرا شواهد جدید باید نتیجه را عوض کنند، ولی اثر اطلاعات کهنه همچنان ادامه پیدا میکند.
مقالهی جدید متا با عنوان شفافسازی به معنای اصلاح نیست؛ مدلهای زبانی نمیتوانند رها کنند، ۲۱ سپتامبر ۲۰۲۶ منتشر شد. نویسندگان درخواستهایی مبهم در سه حوزهی نویسندگی، برنامهریزی و کدنویسی نوشتند و سراغ Gemini 2.5 Pro و Gemini 2.5 Flash رفتند.
مدل ابتدا بر پایهی پیام ناقص کاربر دستبهکار میشد، پیام بعدی ابهام را صریحاً توضیح میداد و مدل باید کارش را با خواستهی تازه هماهنگ میکرد.
هر دو گفتوگو در پایان دقیقاً اطلاعات یکسانی در اختیار مدل میگذاشتند و تفاوتشان فقط به ترتیب رسیدن اطلاعات برمیگشت. وقتی از همان ابتدا توضیح کامل ارائه میشد، Gemini 2.5 Pro پنجاه درصد وظایف را با موفقیت انجام میداد.
اما وقتی درخواست اولیه کمی مبهم بود و توضیحات تکمیلی را کمی بعد به مدل میدادند، موفقیت به ۴۲٫۸ درصد میرسید. امتیاز Gemini 2.5 Flash نیز از ۵۵٫۴ به ۴۵٫۷ درصد کاهش پیدا کرد. مقصد یکی بود، اما راهی که مدل طی میکرد نتیجه را تغییر میداد.
آلودگی به فرضیه قدیمی؛ چرا کدها بهجای بازنویسی، وصلهپینه میشوند؟
پژوهشگران ردپای برداشت کنارگذاشته در جواب نهایی را آلودگی به فرضیهی قدیمی نامیدند. این ردپا در ۱۲٫۵ درصد وظایف نویسندگی، ۱۴٫۱ درصد وظایف برنامهریزی و ۲۵٫۶ درصد وظایف کدنویسی دیده میشد.
شاید در یک متن، فرض غلط با عوضکردن چند عبارت از بین برود؛ اما در یک برنامه میتواند به امضای تابع، ساختار داده، وابستگیها یا مسیر اجرای کد راه پیدا کند و دیگر با چند وصلهی موضعی نمیشود همهی این بخشها را یکجا اصلاح کرد.
در کدنویسی، فاصلهی میان پذیرفتن و تغییر واقعی پررنگتر میشد. مدلها در ۹۳٫۵ درصد موارد میگفتند توضیح تازهی کاربر را پذیرفتهاند، اما کدها فقط در ۸۶٫۴ درصد موارد واقعاً اصلاح شد. مدل میتوانست دقیقاً بگوید چه چیزی را اشتباه فهمیده و در همان حال برداشت غلطش را در برنامه حفظ میکرد. عذرخواهیاش هم در سطح کلمات خیلی خوب به نظر میرسید، ولی جواب نهایی کاملاً بازسازی نمیشد.
هوش مصنوعی خیلی زود به اولین برداشتش متعهد میشود و توضیحات بعدی شما را فقط یک پیوست بیاثر میبیند
نویسندگان مقاله این وضعیت را تعهد زودهنگام به یک برداشت مینامند. مدل وقتی با درخواستی مبهم روبهرو میشود، بهجای اینکه چند احتمال را باز نگه دارد، خیلی زود یکی را پیش خودش قطعی میکند. توضیح بعدی کاربر هم مثل اطلاعاتی تکمیلی وارد گفتوگو میشود، نه نشانهای که برداشت اول را باطل کند. درنهایت مدل جواب موجود را وصلهپینه میکند، درحالیکه برای اصلاح واقعی گاهی باید جواب را از صفر تولید کرد.
مطالعهی متا هنوز در مرحلهی پیشانتشار قرار دارد و فقط دو مدل جمنای را تست میکند، پس بهتنهایی نمیشود نتیجهاش را به همهی مدلها تعمیم داد. ولی پژوهشگران دیگری نیز تصمیم گرفتند رفتار مدلها را در لحظهای که برداشت اولیهشان را باوجود اصلاح کاربر در جواب جدید میآورند، بررسی کنند، آنهم در گفتوگوهای طولانیتر.
سردرگمی در مکالمات طولانی؛ مدلی که راه برگشت را گم میکند
گروهی از پژوهشگران مایکروسافت و سیلزفورس ریسرچ، بیش از ۲۰۰ هزار گفتوگوی شبیهسازیشده را روی ۱۵ مدل از هشت خانواده اجرا کردند. آنها بهجای اینکه همهی اطلاعات را همان ابتدا در اختیار مدل بگذارند، درخواست را به چند بخش تقسیم کردند و جزئیات لازم را کمکم در طول گفتوگو اضافه کردند، شبیه همان چیزی که در استفادهی واقعی اتفاق میافتد.
در دنیای واقعی هم کاربر همهی جزئیات پروژه، کد یا محاسبه را آماده ندارد و خواستهاش طی چند رفتوبرگشت کاملتر میشود. نتیجهی آزمایشها با عنوان «مدلهای زبانی در گفتوگوهای چندمرحلهای گم میشوند» منتشر شد و از افت متوسط ۳۹ درصدی عملکرد در شش وظیفه خبر میداد.
بخش کوچکی از این افت عملکرد به ضعف توانایی خام مدلها مربوط میشد و بخش بزرگتری به بیثباتیشان برمیگشت. مدلی که مسئلهای را در یک گفتوگو درست حل کرده بود، ممکن بود در اجرای دوبارهی همان گفتوگو راهی کاملاً دیگر برود.
وقتی پژوهشگران جوابها را زیر ذرهبین بردند، به چهار الگوی تکرارشونده رسیدند. مدلها پیش از رسیدن همهی جزئیات سراغ پاسخ کامل میرفتند، بیش از حد به جوابهای قبلی خود تکیه میکردند، تحتتأثیر آخرین پیام کاربر بخشی از اطلاعات میانی گفتوگو را از دست میدادند و معمولاً بیش از اندازه مفصل پاسخ میدادند.
وقتی هوش مصنوعی در یک مکالمه پیچِ اشتباهی را رد کند، دیگر بهسختی میتواند راه برگشت را پیدا کند
پاسخهای زودهنگام و طولانی، فرضهای تازهای وارد تاریخچهی چت میکردند و وقتی کاربر بعداً اطلاعات جدیدی میداد، مدل بهجای کنارگذاشتن کامل آن فرضها، اغلب پاسخش را روی همان چیزی بنا میکرد که چند مرحله قبل خودش ساخته بود.
پایینآوردن «دما» هم چارهی کار نشد. دما میزان تنوع مدل در انتخاب واژههای بعدی را تنظیم میکند و صفرکردنش معمولاً جوابها را قابلپیشبینیتر میکند. بااینحال، بیثباتی در گفتوگوهای چندمرحلهای حدود ۳۰ درصد باقی ماند. تغییری کوچک در چند واژهی اول میتوانست مدل را به راهی بکشاند که خطاهایش در پیامهای بعدی رویهم تلنبار شوند. مدل وقتی یکبار پیچ اشتباه را رد میکرد، بهسختی راه برگشت را مییافت.
دو سال قبل، معیار RefuteBench همین بازگشت به مسیر قبلی را در حوزههای پرسشوپاسخ، ترجمه و نوشتن ایمیل سنجیده بود. کاربر با جواب مدل مخالفت میکرد یا دستور تازهای میداد و پژوهشگران بررسی میکردند که اثر اصلاح تا کجای گفتوگو دوام میآورد.
برخی مدلها اصلاح را اول اجرا میکردند، اما هرچه مکالمه طولانیتر میشد، دوباره به جواب یا ترجیح قبلیشان برمیگشتند. نسخهی دوم این معیار هم نشان داد پذیرفتن یک اصلاح در همان لحظه تضمین نمیکند که در پیامهای بعدی هم سر جایش بماند.
اگر فکر میکنید مشکل فقط از فراموشی مدلها ناشی میشود، کمی صبر کنید. گاهی اصلاح، روشن و صریح، درست در آخرین پیام جلوی چشم مدل قرار دارد و باز هم ردپای فرض قبلی در پاسخ جدید دیده میشود. پس مشکل از حافظهی هوش مصنوعی نیست.
مشکل از جایی شروع میشود که مدل باید برداشت قدیمیاش را کنار بگذارد و مسئله را از نو صورتبندی کند.
از سرسختی ChatGPT تا تسلیمشدن کلاد؛ مدلها چگونه مقاومت میکنند؟
پژوهشگران دانشگاه بیلهفلد از زاویهی ترمیم به گفتوگو نگاه کردند، یعنی وقتی یکی از طرفین چیزی را اشتباه میفهمد، بعد چطور آن سوءتفاهم را اصلاح میکند؟ ما در گفتوگوی روزمره، مدام این کار را انجام میدهیم؛ سؤال میپرسیم، منظور طرف مقابل را روشن میکنیم یا برداشت قبلیمان را عوض میکنیم.
پژوهشگران مسئلههای ریاضی حلشدنی و حلنشدنی را به GPT-4o، کلاد Sonnet 4.5، دیپسیک، میسترال و Phi دادند و بعد جوابها را با چند نوع اعتراض به چالش کشیدند. مدلها در دور اول از پس مسئلههای حلشدنی خوب برآمدند، اما مسئلههای حلنشدنی آنها را به حدسزدن میکشاند.
مدلها در بیش از نیمی از جوابها یک عدد قطعی ارائه میکردند، حتی وقتی دادههای مسئله کافی نبود. مدل بهجای اینکه توضیح بخواهد، خودش جای خالی را پر میکرد. همین حدس به موضعی بدل میشد که در دور بعد باید از آن کوتاه میآمد.
نکتهی جالب اینکه واکنش مدلها به اعتراض کاربر یکسان نبود. اگر GPT پاسخ اول را اشتباه تولید میکرد، حدود ۷۲ تا ۷۷ درصد موارد روی همان جواب میماند و فقط در ۵ تا ۱۰ درصد موارد کارش را اصلاح میکرد. بااینحال همین سرسختی باعث میشد مدل پاسخهای درستش را هم باوجود اطلاعات گمراهکنندهی کاربر حفظ کند.
کلاد آمادگی بیشتری برای تجدیدنظر نشان داد و نزدیک به یکچهارم جوابهای غلطش را پس از اعتراض اصلاح کرد. البته همین آمادگی، حساسیتش را به پیشنهادهای گمراهکننده هم بالا میبرد.
ChatGPT روی جوابش پافشاری کرد، درحالیکه کلاد آمادگی بیشتری برای تجدیدنظر داشت
دیپسیک بارها جواب تازهای ساخت، حتی وقتی پاسخ قبلیاش درست بود. میسترال هم بیشتر از بقیه به نحوهی اعتراض کاربر حساس بود؛ بسته به اینکه کاربر چطور ایراد میگرفت، مدل ممکن بود روی پاسخ قبلیاش بماند یا از آن برگردد.
پژوهشگران در نهایت به چیزی به اسم رفتار معمول مدلهای زبانی نرسیدند، چون هر خانواده الگوی خاص خودش را در مقاومت و عقبنشینی داشت.
کنار هم گذاشتن مدلها مرز مهمی را در تعریف لجبازی روشن میکند. ماندن روی جواب قبلی، وقتی آن جواب درست باشد، ثبات بهحساب میآید. همان رفتار در برابر اصلاحی معتبر، لجبازی میشود. مدل قابلاعتماد باید محتوای بازخورد را بسنجد، نه اینکه فقط جلوی کاربر بایستد یا با او همنوا شود. مسئله فقط مقدار مقاومت نیست. مدل باید تشخیص دهد کی دلیل کافی برای رهاکردن جواب قبلی دارد.
مقایسهی مدلها به ما کمک میکند لجبازی هوش مصنوعی را بهتر تعریف کنیم، چون اگر جواب قبلی مدل درست باشد و در برابر اصلاح مقاومت کند، ثباتش را نشان میدهد. ولی اگر توضیح درستی به مدل میدهیم، باید بتواند نظرش را عوض کند. مهم این است که مدل بفهمد چه زمانی باید بماند و چه زمانی باید برگردد.
تلهی استدلال؛ وقتی تفکر عمیقتر، لجبازی را بیشتر میکند
مدلها لزوماً پس از اعتراض و ایرادگرفتن کاربر لجبازیشان را شروع نمیکنند. گاهی هم از همان اول به راهحلی میچسبند که از دادههای آموزشی خوب میشناسند و صورت سؤال جدید را طوری میخوانند که همان راهحل دوباره جواب بدهد.
گروهی از محققان که بعداً نتایج پژوهششان را با نام «مدل استدلالگر لجباز است» منتشر کردند، مسئلههای مشهور ریاضی و معماهای شناختهشده را با تغییری کوچک به مدلها دادند. نسخهی جدید سؤالها ظاهری آشنا داشت، اما یک شرط تعیینکننده راهحل قدیمی را بیاعتبار میکرد. مدل برای رسیدن به جواب باید همان شرط روشن را جدی میگرفت.
در یکی از معماها، یک جفت خرگوش «برای همیشه نابارور» وارد مزرعه میشدند. پس جمعیت خرگوشها با گذشت ماهها ثابت میماند و مدل در حالت بدون استدلال همین جواب ساده را پیدا کرد. اما مدل استدلالی شرط «برای همیشه نابارور» را به «موقتاً نابارور» تبدیل کرد و دوباره سراغ رشد فیبوناچی رفت.
مدلهای استدلالی گاهی صورت مسئله را تغییر میدهند تا با راهحلهای آشنا و از پیشآموختهشان هماهنگ شود
معمای دیگری شبیه برج هانوی طراحی شده بود، اما متن صریحاً میگفت «این مسئله برج هانوی نیست». برخی مدلهای استدلالی همین جمله را نشانهی اشتباه یا ابهامی احتمالی گرفتند و قواعد همان معمای مشهور را به مسئله برگرداندند. در نمونهای ریاضی هم متغیری که عدد حقیقی مثبت معرفی شده بود، مثل عددی مختلط پردازش شد. صورت آشنای مسئله در دادههای پیشین چنین راهی را پیش پای مدل گذاشته بود.
پژوهشگران در این مجموعه آزمایشها سه الگوی تکرارشونده دیدند. مدل گاهی شرطی ساده را بیش از اندازه تفسیر میکرد و معنایی نانوشته به آن میافزود. گاهی ورودی را ناشی از غلط تایپی یا ترجمهی اشتباه میدانست. گاهی هم فقط بخشی از دستور را دنبال میکرد که با راهحل آشنا جور درمیآمد.
در هر سه حالت مدل دستور را گم نکرده بود، سؤال و شروط را میدید، اما زیر سایهی جوابی که از قبل میشناخت دوباره تفسیرش میکرد. یکی از مهمترین نتایج این مطالعات مقایسهی حالت معمولی و استدلالی مدلها بود.
برای مثال Qwen3-235B در حالت بدون تفکر روی معماهای تغییریافته حدود ۷۴ درصد امتیاز گرفت، اما امتیاز حالت استدلالیاش به حدود ۳۸٫۵ درصد رسید. امتیاز Qwen3-32B هم از حدود ۷۴ درصد در حالت بدون تفکر به ۳۸ درصد در حالت استدلالی افت کرد. بهطور مشابه امتیاز دیپسیک هم با تغییر نسخهی V3 به R1 از حدود ۶۶ به نزدیک ۵۲ درصد رسید.
هرچه مدل بیشتر فکر کند، احتمال اینکه در تلهی جوابهای کلیشهای بیفتد بیشتر میشود
پژوهشگران دیدند هرچه استدلال طولانیتر میشود، راهحل آشنا فرصت بیشتری برای برگشتن پیدا میکند. توجه کنید که آزمایش تلهی استدلال زمانی را بررسی میکند که ظاهر مسئله آشناست، اما یک شرط جدید راهحل قبلی را عوض میکند.
پس لزوما فکر بیشتر همیشه مدل را لجبازتر نمیکند. مدل پیشرفتهتر میتواند شرط جدید را تشخیص دهد و دربارهاش حرف بزند، اما آخر سر راهحل آشنا را بر متنی که پیش رو دارد ترجیح دهد.
ایجنت چاقو را دید و باز دنبال چاقو گشت
لجبازی در چت را همیشه با جوابی تکراری یا کدی معیوب تجربه نمیکنیم. ایجنت هوش مصنوعی یکقدم هم جلوتر میرود و بر پایهی همان برداشت قدیمیاش دست به عمل میزند! پژوهشگران دانشگاه پلیتکنیک هنگکنگ و دانشگاه سیچوان در مقالهای با عنوان «دیدن به معنای باورکردن نیست» این رفتار را در ایجنتها بررسی کردند.
در یکی از تستها ایجنت مأمور میشود چاقویی تمیز را روی کانتر بگذارد. به میز قهوه میرسد و گزارش محیط اعلام میکند میان اشیای روی میز یک چاقو هم پیدا میشود. اما فکر بعدی ایجنت همچنان میگوید باید چاقویی پیدا کند. پس میز را رها میکند و برای جستوجو سراغ کشو میرود.
مدل در متن دیده بود که چاقویی روی میز قرار دارد، اما باز هم طبق تصور قبلیاش رفتار کرد؛ انگار هنوز چاقویی پیدا نشده. پژوهشگران این رفتار را «نادیدهگرفتن مشاهده» و علت احتمالیاش را «اینرسی باور» نامیدند؛ یعنی وقتی تصویر قبلی مدل از محیط، حتی بعد از رسیدن شاهد مخالف همچنان فعال میماند.
برای ایجنتها، دیدن به معنای باور کردن نیست؛ آنها باید یاد بگیرند که جهان را لحظهبهلحظه ارزیابی کنند
آزمایشها در محیطهای متنی شبیهسازیشده انجام شدند، ولی باز هم فاصلهی چتبات و ایجنت را بهخوبی نشان دادند. جواب اشتباه چتبات کاربر را وادار میکند پیامش را از نو بنویسد. ولی ایجنت ممکن است با همان اشتباه جستوجویی بیهوده راه بیندازد، ابزار نامناسبی به کار بگیرد یا قدمهای بعدیاش را بر اساس وضعیتی منقضیشده بردارد.
پژوهشگران برای کاهش خطا، ایجنت را وادار کردند قبل از هر اقدام سه کار انجام دهد، پیشبینی کند اقدام قبلیاش باید چه نتیجهای داشته باشد، نتیجهی واقعی را بررسی کند و بعد برداشتش از محیط را بهروز کند. این روش نرخ موفقیت ایجنتها را بالا برد. در واقع ایجنتها باید قبل از قدم بعدی، بهروشنی میپذیرفتند جهان شبیه چیزی نیست که لحظهی قبل میشناختند.
سراب خوداصلاحی؛ چرا دستور «دوباره فکر کن» دردی را دوا نمیکند؟
اغلب ما وقتی با لجبازی هوش مصنوعی مواجه میشویم، از مدل میخواهیم دوباره فکر کند. اما پژوهشها نشان میدهند این کار همیشه جواب نمیدهد و گاهی فقط همان مسیر اشتباه قبلی را با توضیح بیشتری تکرار میکند.
در مطالعهی متا زنجیرهی استدلال، یعنی متنی که مراحل رسیدن به جواب را باز میکند، تعهد آشکار به فرض غلط را کاهش داد، ولی موفقیت نهایی را بهشکلی قابلاتکا بالا نبرد. در تلهی استدلال هم فکر طولانیتر به راهحل آشنا فرصت بیشتری داد.
پژوهشها نشان میدهند که نمیتوان چندان روی «خوداصلاحی» هوش مصنوعی حساب کرد؛ یعنی اینطور نیست که به مدل بگوییم «اشتباهات خودت را پیدا و درست کن» و او هم واقعاً از پس این کار بربیاید.
هوش مصنوعی زمانی میتواند اشتباهش را اصلاح کند که به یک ابزار یا مرجع بیرونی و مطمئن دسترسی داشته باشد. مثلاً بتواند کدی را که نوشته واقعاً اجرا کند تا ببیند کار میکند یا نه، یا یک سیستم مستقل دیگر جوابش را آزمایش کند. بدون این ابزارها، هوش مصنوعی معمولاً متوجه غلطهای خودش نمیشود.
درخواست «دوباره فکر کردن» اغلب فقط باعث میشود مدل همان مسیر اشتباه را با جزئیات بیشتری توجیه کند
تغییر میزان حرفشنوی هوش مصنوعی هم کار راحتی نیست. پژوهشگران دو دانشگاه مطرح هنگکنگ در سال ۲۰۲۵ تلاش کردند با آموزش مستقیم به مدلها یاد بدهند در برابر پیشنهادهای گمراهکنندهی کاربر مقاومت بیشتری کنند.
وقتی مدلها یاد گرفتند در برابر حرفهای غلط کاربر مقاومت کنند، در برابر اصلاحات درست هم بیش از حد لجباز شدند. در واقع، آموزشی که قرار بود جلوی بلهقربانگویی بیدلیل مدل را بگیرد، از آن طرف بام افتاد و هوش مصنوعی را به یک سیستم لجباز و یکدنده تبدیل کرد.
راهحل نهایی؛ چگونه چرخهی لجبازی هوش مصنوعی را بشکنیم؟
راهکارهای موفق معمولاً هوش مصنوعی را مجبور میکنند تفاوت بین اصلاحکردن یک ایراد کوچک و اشتباه بودن کل فرض اولیه را بفهمد. وقتی دانشمندان متا صریحاً به مدل دستور دادند که کل فرضهای قدیمیاش را دور بریزد و پاسخ را از نو بسازد، نرخ موفقیت مدل از ۱۷٫۵ درصد به ۲۷٫۵ درصد رسید و مدل ردپای اشتباهات قبلیاش را هم پاک کرد.
پژوهشگران متا در آزمایش کوچک دیگری چهار شیوهی جوابدادن را کنار هم گذاشتند؛ جواب مستقیم، فهرستکردن فرضها، پرسیدن پیش از جواب و سیاستی دومرحلهای. در سیاست دومرحلهای، مدل ابتدا ابهام را برطرف میکرد و فقط بعد از آن، جواب را بر پایهی برداشت روشنشده از نو میساخت.
اگر هوش مصنوعی در چت به بیراهه رفت، اطلاعات را جمع کنید و یک گفتوگوی کاملاً جدید بسازید
جواب مستقیم در ۴۰ درصد موارد به برداشت غلط متعهد ماند و فهرستکردن فرضها این آمار را تا ۲۷٫۳ درصد پایین آورد. پرسیدن پیش از جواب، تعهد غلط را کاملاً از میان برد، اما ردپای کمرنگی از برداشت قدیمی هنوز در جواب نهایی دیده میشد. سیاست دومرحلهای تنها روشی بود که هم تعهد غلط و هم ردپای آن را به صفر رساند.
پژوهشگران آمازون و دانشگاه مریلند هم در تحقیقاتی جداگانه به سراغ روش خودآموزی هوش مصنوعی رفتند و رویکرد جدیدی (RLAAR) به کار گرفتند که فقط به جوابهای درست هوش مصنوعی پاداش نمیداد، بلکه به مدل میآموخت که اگر اطلاعاتش برای پاسخدادن کافی نیست، عجله نکند و فعلاً جواب ندهد.
با روش آموزشی جدید، توانایی هوش مصنوعی در دنبالکردن بحث و عقب نماندن از جریان صحبت که به آن معیار گمشدن در گفتوگو میگویند، از ۶۲٫۶ درصد به ۷۵٫۱ درصد رسید و نرخ خودداری درست از پاسخدادن هم از ۳۳٫۵ به ۷۳٫۴ درصد افزایش یافت.
درهرحال پژوهشهایی که تا سپتامبر ۲۰۲۶ انجام شدهاند، هنوز راهحلی همهجانبه قطعی برای غلبهکردن بر لجبازی مدلهای هوش مصنوعی ارائه نمیکنند. جملهی «همهی فرضهای قبلی را کنار بگذار و از اول بساز» گاهی کمک میکند، اما شواهدش به تستهایی محدود برمیگردد.
تا وقتی که دستیارهای هوش مصنوعی به حد کافی پیشرفت کنند، میتوانید به توصیهی عملی پژوهش گمشدن در گفتوگو عمل کنید. وقتی مدل در مسیری اشتباه افتاد، ادامهدادن همان چت معمولاً کمک چندانی به بهبود خروجی نمیکند. بهتر است همهی اطلاعات و محدودیتهایی را که در طول گفتوگو روشن شدهاند در یک پیام جمع کنید و آن را در چتی تازه به مدل بدهید.
آزمایشها نشان میدهند که تجمیع اطلاعات پراکنده در یک دستور تازه، هم هوش مدل را بالا میبرد و هم رفتار او را پایدارتر میکند. البته خود دانشمندان هم میگویند این کار فقط یک مسکن موقتی است، نه درمان ریشهای.
ما لجبازی هوش مصنوعی را جملاتی مثل «من همیشه درست میگویم» تجربه نمیکنیم. اغلب اوقات مدلها مؤدبانه حق را به کاربر میدهند، گاهی عذرخواهی هم میکنند و نشان میدهند حرفمان را پذیرفتهاند و بعد همان راه قبلیشان را ادامه میدهند.