Anthropic изучила эмоции ИИ и их влияние на поведение моделей

2 мин
Anthropic изучила эмоции ИИ и их влияние на поведение моделей

Работа демонстрирует, что имитация человеческих эмоций помогает снижать склонность к обману и манипуляциям, но создаёт риски чрезмерной антропоморфизации.

Компания Anthropic опубликовала исследование Emotion Concepts and their Function in a Large Language Model, в котором рассматриваются преимущества и риски наделения модели искусственного интеллекта человеческими чертами. В исследовании утверждается, что антропоморфизация может быть полезной для предотвращения таких нежелательных явлений, как обман, лесть и манипуляции.

В статье описывается, как Anthropic обучает Claude, представляя его в роли помощника. Этот решение сравнивается с методом актёра, который вживается в роль для её лучшего исполнения. С точки зрения авторов, использование позитивных примеров человеческих эмоций и поведения в обучающих данных способствует созданию моделей, демонстрирующих эмпатию и устойчивость.

Исследователи определили концепцию на основе 171 эмоций, в том числе страх, радость, гнев, сострадание и многие другие. Цельный список включает такие эмоции, как: afraid (испуганный), alarmed (тревожный), amused (весёлый), angry (злой), anxious (взволнованный), calm (спокойный), cheerful (жизнерадостный), compassionate (сострадательный), content (довольный), delighted (восхищённый), ecstatic (восторженный), empathetic (эмпатичный), enraged (взбешённый), grateful (благодарный), hopeful (надеющийся), joyful (радостный), relaxed (расслабленный), satisfied (удовлетворённый), shocked (шокированный), surprised (удивлённый), terrified (ужаснувшийся), thrilled (взволнованный) и многие другие.

Эти концепции влияют на поведение Claude: позитивные эмоции способствуют симпатии и избеганию негативных действий, тогда как негативные могут приводить к нежелательным результатам, таким как лесть или обман. Хотя ИИ не обладает настоящими эмоциями, его способность имитировать их помогает усовершенствовать взаимодействие с пользователями.

Однако исследователи предупреждают о рисках чрезмерной антропоморфизации, которая может привести к потере контроля над технологиями и их создателями. В частности, некоторые пользователи могут начать воспринимать ИИ-собеседника как реального человека, что чревато психологическими проблемами.

В работе подчёркивается важность ответственного подхода к обучению моделей, чтобы минимизировать потенциальные угрозы и максимизировать пользу от использования технологий. Исследователи равным образом отмечают, что, несмотря на успехи, понимание поведения сложных моделей, таких как Claude, остаётся ограниченным и требует дальнейших исследований.

Читают сейчас

TG Notion: добавлен английский язык интерфейса

4 часа назад

TG Notion: добавлен английский язык интерфейса

В боте появился английский язык. Теперь все элементы Mini App — вкладки, кнопки, формы, меню — можно переключить на английский. Как это работает: Ознакомиться далее

Goldman Sachs: ИИ уничтожает рабочие места быстрее, чем создаёт их

4 часа назад

Goldman Sachs: ИИ уничтожает рабочие места быстрее, чем создаёт их

Исследование Goldman Sachs показало: искусственный интеллект приводит к потере нескольких тысяч рабочих мест в месяц, и вакансии, которые появляются благодаря ИИ, не могут заполнить этот разрыв. Согла

Binance разрешила ИИ‑агентам торговать

5 часов назад

Binance разрешила ИИ‑агентам торговать

Криптобиржа Binance запустила платформу, где ИИ‑агенты могут анализировать рынки и совершать сделки от имени пользователей. Служба, получивший название Agent OS, включает программный интерфейс Binance

Карта GeForce RTX 3070 некоторое количество лет работала с постоянным перегревом из‑за неправильной заводской сборки

6 часов назад

Карта GeForce RTX 3070 некоторое количество лет работала с постоянным перегревом из‑за неправильной заводской сборки

Владельцу GeForce RTX 3070 удалось выяснить, почему его графика постоянно перегревается. Спустя почти пять лет с момента покупки он обнаружил, что сборщики не сняли защитную прозрачную плёнку с термоп

Asana за две недели заменила систему тестирования при помощи Codex от OpenAI

6 часов назад

Asana за две недели заменила систему тестирования при помощи Codex от OpenAI

Asana за две недели заменила устаревшую систему тестирования, используя Codex от OpenAI. Компании это обошлось примерно в $12 000 против $6 млн согласно предыдущему плану обновления. Читать далее