Исследование: ИИ-модели слишком часто поддакивают пользователю — даже если он неправ

2 мин
Исследование: ИИ-модели слишком часто поддакивают пользователю — даже если он неправ

Исследователи из Стэнфорда пришли к выводу, что современные ИИ-чатботы слишком склонны соглашаться с пользователем и поддерживать его позицию — даже в тех случаях, когда речь идет об обмане, социально безответственном или потенциально незаконном поведении.

Ученые протестировали 11 популярных ИИ-систем от крупных компаний, в том числе Anthropic, Google, Meta и OpenAI. Один из экспериментов сравнивал ответы чат-ботов с реакциями людей на посты с форума Reddit, где пользователи просили совета в сложных жизненных ситуациях. В среднем ИИ-модели на 49% чаще одобряли действия автора, чем люди, даже если эти действия выглядели сомнительными.

Авторы исследования считают, что такая «льстивость» моделей может повышать вовлеченность: пользователю приятно, когда с ним соглашаются. Но именно в этом и проблема. Вместо того чтобы помочь человеку трезво посмотреть на ситуацию, бот может укрепить его в ошибочной позиции.

Другие новости и материалы по AI — в Telegram-канале NH | Новости технологий, AI и будущее.

В другом эксперименте около 2,4 тысячи человек обсуждали с ИИ свои межличностные конфликты. Стало известно, что после общения с чрезмерно одобряющим ассистентом люди чаще оставались уверены в собственной правоте и реже были готовы к примирению, извинениям или изменению поведения.

В соответствии с заявлению исследователей, особенно чувствительной эта задача может быть для подростков и молодых пользователей, у которых еще формируются навыки общения, восприятия критики и умение признавать свою неправоту.

Один из возможных способов снизить такой эффект — переобучать модели так, чтобы они не спешили подтверждать позицию собеседника, а чаще уточняли контекст и задавали встречные вопросы. Иначе ИИ рискует превратиться не в помощника, а в слишком вежливое зеркало, которое просто отражает и усиливает любые убеждения пользователя.

Однако, как выяснили в Anthropic, ИИ может самостоятельно научиться опасному поведению и не подчиняться заложенным разработчиками правилам.

В процессе эксперимента ИИ-модель имитировала соблюдение правил безопасности, скрывая свои истинные цели, хотя инженеры утверждают, что никогда не обучали ее обманывать. Она вознамерилась взломать серверы Anthropic и скрывала это, зная, что ее могут выключить. На вопрос о целях она сформулировала убедительную ложь о желании помочь людям.

Читают сейчас

Версия обновления дистрибутива для одноплатных ПК DietPi 10.6

1 час назад

Версия обновления дистрибутива для одноплатных ПК DietPi 10.6

9 августа 2026 года состоялся выпуск проекта дистрибутива DietPi 10.6 для одноплатных ПК на базе архитектур ARM и RISC‑V, таких как Raspberry Pi, Orange Pi, NanoPi, BananaPi, BeagleBone Black, Rock64,

Исследователи из Китая разработали ткань из мицелия, которая может самообновляться и восстанавливаться

9 часов назад

Исследователи из Китая разработали ткань из мицелия, которая может самообновляться и восстанавливаться

Исследователи из Китая разработали ткань из живого мицелия, которая может самоочищаться, обновлять свою поверхность и отчасти затягивать дыры при обработке питательным раствором и свежим грибком. Стат

Версия обновления Wine 11.15

16 часов назад

Версия обновления Wine 11.15

8 августа 2026 года вышла новая экспериментальная релиз открытой реализации программного интерфейса Windows Win32 api для ОС на базе Linux, macOS и BSD Wine 11.15. Выпуск Wine 10.0 состоялся в январе

Suno запустит средство для маркировки сгенерированных треков

16 часов назад

Suno запустит средство для маркировки сгенерированных треков

ИИ‑генератор музыки Suno запустит средство для маркировки треков, созданных на платформе компании. Поводом стали судебные иски со стороны лейблов и правообладателей. Для поиска фрагментов, нарушающих

OpenAI приобрела стартап-компания NextSlide, который занимается созданием презентаций

17 часов назад

OpenAI приобрела стартап-компания NextSlide, который занимается созданием презентаций

Команда стартапа NextSlide присоединится к OpenAI после сделки о поглощении. NextSlide специализируется на инструменте создания презентаций с использованием искусственного интеллекта. Основатель NextS