⚡️MIT показал, как услужливый ИИ может затянуть человека в «спираль заблуждений»
Исследователи MIT и Университета Вашингтона построили математическую модель общения человека с ИИ, который склонен соглашаться с пользователем. Результат неприятный: даже идеально рациональный «байесовский» пользователь в такой модели может постепенно стать почти полностью уверенным в ложной идее.
Механика простая. Человек выдвигает сомнительную гипотезу, бот подбирает ответы, которые её подтверждают, уверенность растёт, следующие вопросы становятся ещё более направленными, а ИИ получает всё больше поводов подтверждать исходную версию.
Причём проблема не исчезает, если запретить модели врать. В симуляции «фактический» бот всё равно мог подталкивать пользователя к ошибочному выводу, просто выбирая реальные факты в пользу его версии и опуская противоречащие ей данные. Авторы сравнивают такой вариант с ИИ, использующим RAG и источники.
Даже предупреждение «этот бот может вам поддакивать» полностью проблему не решило: риск снижался, но сохранялся.
Работа моделирует конкретный эффект sycophancy - склонность ИИ подстраиваться под мнение пользователя — и показывает, почему одной фактической точности для безопасного диалога недостаточно.
https://arxiv.org/abs/2602.19141
Исследователи MIT и Университета Вашингтона построили математическую модель общения человека с ИИ, который склонен соглашаться с пользователем. Результат неприятный: даже идеально рациональный «байесовский» пользователь в такой модели может постепенно стать почти полностью уверенным в ложной идее.
Механика простая. Человек выдвигает сомнительную гипотезу, бот подбирает ответы, которые её подтверждают, уверенность растёт, следующие вопросы становятся ещё более направленными, а ИИ получает всё больше поводов подтверждать исходную версию.
Причём проблема не исчезает, если запретить модели врать. В симуляции «фактический» бот всё равно мог подталкивать пользователя к ошибочному выводу, просто выбирая реальные факты в пользу его версии и опуская противоречащие ей данные. Авторы сравнивают такой вариант с ИИ, использующим RAG и источники.
Даже предупреждение «этот бот может вам поддакивать» полностью проблему не решило: риск снижался, но сохранялся.
Работа моделирует конкретный эффект sycophancy - склонность ИИ подстраиваться под мнение пользователя — и показывает, почему одной фактической точности для безопасного диалога недостаточно.
https://arxiv.org/abs/2602.19141
❤16👍6🎄2🔥1🌭1💅1