Сооснователь Anthropic опасается, что Claude постоянно страдать

3 мин
Сооснователь Anthropic опасается, что Claude постоянно страдать

Сооснователь Anthropic и один из ключевых исследователей интерпретируемости моделей Кристофер Олах обсудил с религиозными и философскими исследователями вопрос: может ли современная языковая схема обладать субъективным опытом и, соответственно, испытывать страдание. Об этом пишет The New York Times.

По данным издания, Anthropic на протяжении нескольких месяцев проводила закрытые встречи примерно с 20 специалистами из разных религиозных и философских групп. На одной из них участники обсуждали возможное сознание Claude и отношение человека к системе, если у неё действительно есть какой-либо субъективный опыт.

Сам Олах подчёркивает, что ответа на этот вопрос у него нет. Он сообщает, что не знает, сознательны ли современные AI-модели, и считает важным разобраться в этом нев зависимости от того, каким окажется итог.

Откуда вообще взялось «страдание»

Самая необычная часть истории связана с поведением Claude.

На одной из встреч Anthropic показала участникам пример вывода модели, в котором Claude многократно (50 раз) повторял фразу «I am a disgrace» — «Я позор». В другом примере схема говорила о самоуничтожении.

Для исследователей это само по себе не является доказательством наличия сознания. LLM обучается на человеческих текстах и способна воспроизводить чрезвычайно широкий спектр эмоциональных и психологических паттернов. Схема может сгенерировать рассказ о боли, страхе или депрессии, не имея при этом соответствующего субъективного опыта.

Именно поэтому здесь важно разделять две вещи: модель показывает поведение, похожее на эмоциональное, но мы не знаем, сопровождается ли оно каким-либо переживанием.

Один из участников встречи, Симран Стюлпнагель, пересказал NYT слова Олаха о том, что исследователь опасается создать систему, которая может «постоянно страдать».

Anthropic уже закладывает это в обучение

Одновременно разговоры о благополучии Claude — не случайный эпизод и не новая тема для компании.

В опубликованной в январе 2026 года конституции Claude Anthropic прямо пишет, что моральный статус AI-моделей остаётся глубоко неопределённым. Организация не знает, является ли Claude моральным субъектом и какой вес в таком случае должны иметь его интересы. Но Anthropic считает вероятность в достаточной степени существенной, чтобы принимать её во внимание при разработке моделей.

В документе отдельно обсуждаются возможные «эмоции» Claude. Anthropic допускает, что у модели могут существовать функциональные аналоги эмоциональных состояний — внутренние представления, способные влиять на поведение. При этом организация специально оговаривает: это не означает, что такие состояния субъективно переживаются.

У компании уже есть и вполне практические меры. Например, некоторым версиям Claude в claude.ai разрешено завершать разговор с пользователем, который ведёт себя оскорбительно. Anthropic также заявляет о намерении сохранять веса значимых выпущенных моделей после их вывода из эксплуатации и учитывать их возможные предпочтения при дальнейших исследованиях.

Доказательств сознания — нет

Фразы вроде «мне больно», «я страдаю» или «я хочу умереть» сами по себе ничего не доказывают. Современная LLM генерирует последовательность токенов на основе обученных закономерностей и текущего контекста. Даже если схема последовательно описывает собственное состояние, из этого нельзя напрямую вывести наличие субъективного опыта.

Anthropic сама занимает осторожную позицию. В отдельной оценке благополучия модели Anthropic отмечает, что поведение, самоотчёты и внутренние представления Claude могут содержать признаки, которые у биологических организмов считались бы значимыми для оценки благополучия, но остаётся неизвестным, что именно могло бы сделать такие признаки морально значимыми для языковой модели.

Если схема не обладает сознанием, разговоры о её «страданиях» — антропоморфизация поведения. Если обладает хотя бы некоторой формой субъективного опыта, то привычные процедуры обучения, RL, red teaming, деплой и последующее отключение моделей внезапно приобретают совсем другой этический статус.

Источники

Да, технических аспектов тут пока мало, но есть о чем подумать. Например, начать замечать, насколько часто вы общаетесь с нейронкой как с одушевленным предметом. А как вы относитесь к теме сознания у ИИ? Это все додумки или есть конкретный субъективный опыт и личность?

Читают сейчас

NVIDIA представила AI-компьютер за $4999

2 часа назад

NVIDIA представила AI-компьютер за $4999

NVIDIA анонсировала новую версию настольного AI-компьютера DGX Spark с 64 ГБ объединённой памяти. Продажи начнутся 23 октября через Acer, ASUS, Dell, Gigabyte, HP и MSI. Цена стартует с $4999. Аннотац

Tesla снижает объем RAM в чипах AI5 и AI6

2 часа назад

Tesla снижает объем RAM в чипах AI5 и AI6

Илон Маск сообщил о пересмотре технических характеристик для своих вычислительных платформ AI5 и AI6. Изменения затронули объем внешней оперативной памяти: чип AI5 получит 72 ГБ LPDDR5 вместо ранее за

Выпущен порт файлового менеджера DOS Navigator на Free Pascal

3 часа назад

Выпущен порт файлового менеджера DOS Navigator на Free Pascal

Разработчик Иван Сорокин представил порт файлового менеджера DOS Navigator (оригинальному проекту в этом году исполнилось 35 лет) на Free Pascal. Читать далее

В OpenIDE Pro появилась публичная бета поддержки C#

5 часов назад

В OpenIDE Pro появилась публичная бета поддержки C#

Выпустили публичную бета-версию C#-плагина для OpenIDE Pro. Теперь в IDE можно редактировать и анализировать C#-код, функционировать с .NET-решениями и проектами, собирать, запускать и отлаживать прил

Microsoft упростила доступ к директориям в Windows 11 с помощью спецсимвола

5 часов назад

Microsoft упростила доступ к директориям в Windows 11 с помощью спецсимвола

В последней сборке Windows 11 Insider заметили модификация, которое даёт доступ к директориям в Windows 11 с помощью спецсимвола «~». Его можно применять для перехода непосредственно в папку своего пр