В MIT научили ИИ предупреждать о галлюцинациях

3 мин
В MIT научили ИИ предупреждать о галлюцинациях

Рассуждающие модели ИИ отвечают одинаково уверенно и тогда, когда действительно знают ответ, и тогда, когда просто угадывают. Исследователи из MIT CSAIL утверждают, что нашли корень проблемы и предложили метод ее исправить без потери точности. В конце апреля работу Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty представят на ICLR.

Команда сравнивает поведение современных рассуждающих моделей с "самым громким голосом в комнате": модель говорит, что уверена на 95%, но оказывается права лишь в половине случаев. По словам авторов, такая платформа опаснее модели, которая просто ошибается: у пользователя нет повода усомниться в ответе и поискать второе мнение. В медицине, праве и финансах это особенно критично.

Ресурс проблемы оказался в самой функции награды стандартного RL, которым обучают современные reasoning-модели. Она бинарная: оценивает только правильность финального ответа. Угадывание монеткой и аккуратное рассуждение зарабатывают одинаковую награду, если ответ верен. А воздержание от ответа и неправильный ответ оцениваются одинаково — модели выгоднее всегда что-то отвечать, чем признать неуверенность. Со временем она усваивает простую стратегию — отвечать с непоколебимой уверенностью на все подряд. "Стандартный решение к обучению прост и эффективен, но не дает модели стимула выражать неуверенность или говорить “не знаю", — объясняет соавтор работы Мехул Дамани, аспирант MIT.

Подход, которое команда назвала RLCR — Reinforcement Learning with Calibration Rewards, — добавляет к функции награды еще один элемент: метрику Брайера (Brier score). Это классическая показатель, которая штрафует за разрыв между заявленной уверенностью и фактической точностью. В итоге модель учится не только решать задачу, но и оценивать собственную уверенность в ответе. Уверенно неправильные ответы наказываются. Неуверенно правильные — тоже. Авторы математически доказали, что такая структура награды даёт возможность одновременно сохранять точность и улучшать калибровку.

Способ проверили на модели с 7 млрд параметров и шести наборах данных, которых она не видела при обучении. RLCR сократил ошибку калибровки максимум на 90 процентов — без потери точности как на знакомых, так и на новых задачах. Отдельная важная находка: обычное обучение с подкреплением для reasoning-моделей не нейтрально к калибровке, а ухудшает ее относительно базовой моделью. "Удивительно, что обычное RL-обучение не просто не помогает калибровке. Оно ей активно вредит. Модели становятся способнее и одновременно более самонадеянными", — говорит соавтор Иша Пури.

Самооценка уверенности оказалась полезной и на этапе вывода. Если генерировать несколько ответов и выбирать тот, в котором модель уверена сильнее, или учитывать уверенность при голосовании большинства, точность растет наряду с увеличением вычислительных ресурсов. Еще один итог: рассуждения модели о собственной неуверенности несут полезную информацию, а не служат украшением. Если добавить такую цепочку рассуждений на вход отдельному классификатору, он работает лучше — особенно в случае небольших моделей.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Читают сейчас

OpenAI привлекла сотни сторонних подрядчиков, которые читают и оценивают реальные переписки пользователей с ChatGPT

1 час назад

OpenAI привлекла сотни сторонних подрядчиков, которые читают и оценивают реальные переписки пользователей с ChatGPT

OpenAI привлекла сотни сторонних подрядчиков, которые читают и оценивают реальные переписки пользователей с ChatGPT для улучшения моделей искусственного интеллекта компании. Об инициативе под кодовым

Карманный LoRa-коммуникатор ThinkNode M9 с QWERTY-клавиатурой

2 часа назад

Карманный LoRa-коммуникатор ThinkNode M9 с QWERTY-клавиатурой

Компания Elecrow выпустила ThinkNode M9 — компактный коммуникатор для обмена сообщениями без сотовой связи и доступа к интернету. Внешне устройство напоминает старые смартфоны BlackBerry: почти полови

Gartner: ИИ-компаниям пока нельзя доверять серьёзные задачи бизнеса

2 часа назад

Gartner: ИИ-компаниям пока нельзя доверять серьёзные задачи бизнеса

За ошибку искусственного интеллекта отвечать будет не тот, кто его разработал, а тот, кто им пользовался. И это уже не догадка, а прямое предупреждение крупнейшей аналитической фирмы, как сообщает The

«Сбер» показал Time Adapter — надстройку к генеративным моделям для управления динамикой событий и частотой кадров

2 часа назад

«Сбер» показал Time Adapter — надстройку к генеративным моделям для управления динамикой событий и частотой кадров

Команда ИИ-проекта Kandinsky «Сбера» разработала подход под названием Time Adapter. Инициатива предоставляет собой надстройку к генеративным моделям, которая управляет динамикой событий и частотой кад

В Wizards of the Coast подтвердили: сюжет Warlock будет строго линейным

2 часа назад

В Wizards of the Coast подтвердили: сюжет Warlock будет строго линейным

После триумфа Baldur’s Gate 3 кажется, что абсолютная свобода выбора стала обязательным атрибутом любой фэнтезийной RPG. Larian Studios задала свежий «золотой стандарт», к которому сегодня пытаются пр