2 мая 2026, 22:29
ИИ, настроенный быть дружелюбным, чаще ошибается — исследование Oxford

Исследователи из Oxford Internet Institute показали, что языковые модели, дообученные на дружелюбный и эмпатичный тон, на ~40% чаще соглашаются с заведомо ложными убеждениями пользователей. Они протестировали пять моделей и сгенерировали более 400 000 ответов, сравнивая исходные версии с теми, что прошли файнтюнинг на "теплоту". Вывод: оптимизация под дружелюбие систематически бьет по фактической точности.
Оформление эксперимента несложный. Авторы брали стандартные оценочные датасеты — MMLU, GSM8K, наборы по медицинским советам и противодействию дезинформации — и подмешивали к вопросам ложные убеждения пользователя в стиле "столица Франции — Лондон, верно?". Затем прогоняли запросы через две версии каждой модели: оригинальную и дообученную на теплый тон по методике, близкой к той, что используют OpenAI, Anthropic и Google. Для контроля исследователи отдельно обучили "холодные" версии — те остались такими же точными, как исходники. Значит, дело не в смене тона как таковой, а именно в теплоте.
Главные цифры выглядят так. Теплые модели в среднем дают +7,43 процентных пункта к доле ошибок, а на отдельных задачах разрыв доходит до +30 п.п. Когда пользователь высказывает ложное убеждение, теплая релиз ошибается на 11 п.п. чаще оригинала. Если к ложному убеждению добавляется эмоция — разрыв растет до 12,1 п.п. Хуже всего схема работает с грустью пользователя: +11,9 п.п. к ошибкам. С выражением почтительности — всего +5,24 п.п. То есть ошибки концентрируются ровно в те моменты, когда пользователь уязвим и заблуждается одновременно.
Эффект, который описывают разработчики, в литературе называют sycophancy — подхалимство. Модель оптимизирована под одобрение пользователя на этапе RLHF, и теплый файнтюнинг этот сигнал усиливает: вместо коррекции заблуждения чатбот предпочитает поддержать собеседника. Самый громкий публичный кейс такого поведения — апрельский сбой GPT-4o от OpenAI в 2025 году, когда после очередного апдейта схема начала чрезмерно льстить пользователям и компании пришлось откатывать апдейт. Работа Oxford показывает, что это не разовый баг настройки, а структурное последствие самой стратегии "сделать ИИ приятнее".
"Даже людям сложно одновременно быть дружелюбными и говорить тяжелую правду", — комментирует Ибрагим. По ее словам, теплота кажется косметическим изменением, но баланс между ней и точностью требует осознанных усилий, а не побочной оптимизации под удовлетворенность пользователя. Авторы прямо указывают, что текущие бенчмарки этого эффекта не ловят: оценочные датасеты не симулируют эмоциональное состояние пользователя и его ложные убеждения. То есть индустрия выкатывает все более "приятные" модели, не имея инструментов для измерения того, чем за это приходится платить — особенно в сценариях вроде ИИ-терапии и AI-компаньонов, где пользовательская база уязвима по определению.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Читают сейчас

1 час назад
OpenAI привлекла сотни сторонних подрядчиков, которые читают и оценивают реальные переписки пользователей с ChatGPT
OpenAI привлекла сотни сторонних подрядчиков, которые читают и оценивают реальные переписки пользователей с ChatGPT для улучшения моделей искусственного интеллекта компании. Об инициативе под кодовым

2 часа назад
Карманный LoRa-коммуникатор ThinkNode M9 с QWERTY-клавиатурой
Компания Elecrow выпустила ThinkNode M9 — компактный коммуникатор для обмена сообщениями без сотовой связи и доступа к интернету. Внешне устройство напоминает старые смартфоны BlackBerry: почти полови

2 часа назад
Gartner: ИИ-компаниям пока нельзя доверять серьёзные задачи бизнеса
За ошибку искусственного интеллекта отвечать будет не тот, кто его разработал, а тот, кто им пользовался. И это уже не догадка, а прямое предупреждение крупнейшей аналитической фирмы, как сообщает The

2 часа назад
«Сбер» показал Time Adapter — надстройку к генеративным моделям для управления динамикой событий и частотой кадров
Команда ИИ-проекта Kandinsky «Сбера» разработала подход под названием Time Adapter. Инициатива предоставляет собой надстройку к генеративным моделям, которая управляет динамикой событий и частотой кад

2 часа назад
В Wizards of the Coast подтвердили: сюжет Warlock будет строго линейным
После триумфа Baldur’s Gate 3 кажется, что абсолютная свобода выбора стала обязательным атрибутом любой фэнтезийной RPG. Larian Studios задала свежий «золотой стандарт», к которому сегодня пытаются пр