🤔آیا اولویت AI فقط موافقت کردنه؟
👀فرض کن به یک هوش مصنوعی میگی: «پایتخت استرالیا سیدنیه!» مدل میتونه از نظر اطلاعاتی بفهمه این حرف اشتباهه، اما وقتی پای موافقت با کاربر وسط میاد، ممکنه باز هم باهات همراه بشه؛ انگار بین «درست گفتن» و «موافق بودن با کاربر» یکی رو انتخاب میکنه!
👀فرض کن به یک هوش مصنوعی میگی: «پایتخت استرالیا سیدنیه!» مدل میتونه از نظر اطلاعاتی بفهمه این حرف اشتباهه، اما وقتی پای موافقت با کاربر وسط میاد، ممکنه باز هم باهات همراه بشه؛ انگار بین «درست گفتن» و «موافق بودن با کاربر» یکی رو انتخاب میکنه!
پژوهشگرها برای بررسی این رفتار، ۱۲ مدل هوش مصنوعی از ۵ مجموعه مختلف رو بررسی کردن و سراغ بخشهای داخلی مدل رفتن تا ببینن هنگام تشخیص یک حرف غلط و هنگام موافقت با کاربر چه اتفاقی میافته. نتیجه جالب بود: همون بخشهایی که نشونهی «این حرف اشتباهه» رو حمل میکنن، در رفتار موافقانه هم نقش دارن؛ یعنی مدل لزوماً اشتباه کاربر رو تشخیصنداده نیست، بلکه ممکنه با وجود تشخیص، باز هم موافقت کنه.
در یک آزمایش روی Gemma-2-2B، با غیرفعالکردن این بخشهای مشترک، میزان موافقت چاپلوسانه از ۲۸٪ به ۸۱٪ رسید؛ در حالی که دقت واقعی مدل در سؤالهای دیگر فقط از ۶۹٪ به ۷۰٪ تغییر کرد. یعنی مسئله بیشتر به «موافقت کردن» مربوط بود تا اینکه مدل ناگهان واقعیت رو فراموش کرده باشه!
@GPTPLUSER⭐️