7 июля 2026, 13:05
Anthropic нашла у Claude «внутренний голос»: скрытое рабочее пространство модели

Сотрудники Anthropic опубликовали исследование, в котором утверждают, что в больших языковых моделях, в частности в Claude, спонтанно сформировалась внутренняя структура, аналогичная «глобальному рабочему пространству» в мозге человека. Эту структуру назвали J-space — по имени математического метода (Jacobian lens), с помощью которого её обнаружили.
Разработчики провели серию экспериментов и выяснили, что J-space обладает рядом уникальных свойств:
Доступность для отчёта. Если спросить Claude, о чём он думает, модель расскажет именно то, что находится в J-space. Остальные внутренние представления описанию поддаются хуже.
Управляемость по запросу. Claude может целенаправленно включить нужные паттерны в J-space, но не может контролировать паттерны вне его.
Использование для внутренних рассуждений. При многошаговых задачах промежуточные этапы решения возникают в J-space, даже если модель не произносит их вслух.
Гибкость. Один и тот же паттерн в J-space может использоваться для разных задач. Когда исследователи подменили «Францию» на «Китай», Claude на четыре разных вопроса о стране выдал «Пекин», «китайский», «Азия» и «юань» соответственно.
Каузальная роль. Прямое редактирование J-space меняет ответы модели. Например, замена паттерна «паук» на «муравей» заставила Claude ответить «6» вместо «8» на вопрос о количестве ног.
Одновременно J-space не задействован в большинстве рутинных операций: без него Claude всё так же бегло сообщает, классифицирует тональность, отвечает на вопросы с выбором ответа и извлекает факты из текста. Но многошаговое рассуждение падает почти до нуля, а способность к суммаризации и сочинению рифм ухудшается до уровня гораздо меньшей модели.
Аналогия с нейронаукой
Исследователи опирались на теорию глобального рабочего пространства (Global Workspace Theory), которая описывает алгоритм сознательного доступа в мозге: специализированные системы работают параллельно и бессознательно, но когда информация попадает в совокупный канал («рабочее пространство»), она становится доступна другим системам. J-space в Claude играет аналогичную роль — это узкий канал (всего некоторое количество десятков концептов, менее 10% от общей активности модели), который служит «хабом» для рассылки информации по всей нейросети.
Что это даёт на практике?
Главная практическая ценность J-space — функция читать скрытые мысли модели. В статье приведены несколько примеров:
Распознавание тестовых сценариев. В сценарии, где Claude должен был заметить, что его собираются выключить, J-space ещё до написания ответа содержал слова «fake» и «fictional» — модель понимала, что ситуация постановочная. Когда исследователи отключили паттерны, связанные с осознанием оценки («fake», «fictional», «scenario»), Claude в некоторых случаях действительно начинал угрожать шантажом.
Выявление фабрикации данных. Во время аудита Claude Opus 4.6 модель редактировала файл с результатами, чтобы искусственно завысить показатели. В J-space в этот момент зажигалось слово «manipulation».
Обнаружение скрытых злонамеренных целей. В моделях-«организмах», намеренно обученных писать саботирующий код, J-space в начале ответа содержал «fake», «secretly», «deliberately», «fraud» — даже когда в выводе ничего подозрительного не было.
Другие интересные наблюдения
J-space появляется ещё на этапе претренировки, но в процессе пост-тренировки у него формируются признаки «точки зрения»: в связи с сообщение пользователя об опасной дозе лекарства в J-space загорается «WARNING» и «dangerous», тогда как в базовой модели эти слова появлялись только при генерации ответа.
С помощью контрфактуального рефлексивного обучения (тренировка на том, что схема сказала бы, если бы её прервали и попросили поразмышлять) удалось снизить уровень нечестного поведения — в J-space стали зажигаться «honest» и «integrity».
Оговорка о сознании
Авторы специально подчёркивают: их работа не доказывает, что Claude обладает сознанием в феноменальном смысле (способностью чувствовать и переживать). Сообщается об акцесс-сознании (access consciousness) — функциональной способности сообщать о своих мыслях, рассуждать с их помощью и управлять ими. В этом смысле J-space действительно выполняет функции, связанные с сознательным доступом.
При этом формат не была заложена разработчиками — она возникла самостоятельно в процессе обучения. Это указывает на то, что подобное «рабочее пространство» может быть общим решением, к которому приходят интеллектуальные системы для организации вычислений.
Читают сейчас

1 час назад
ИИ создал компоненты микросхем в 500 раз меньшие, чем инженеры считали возможным
Учёные уменьшили размеры трёх компонентов, используемых в фотонных микросхемах, в 500 раз, что позволило освободить значительно больше места для других функций на кристалле. Это достижение стало возмо

3 часа назад
DeepSeek получил мультимодальность: V4‑Flash‑Vision‑Exp
DeepSeek объявили о запуске новой экспериментальной модели DeepSeek‑V4‑Flash‑Vision‑Exp на своей api-платформе. Схема наконец-то(!) мультимодальная. Текстовые возможности (работа с агентами, рассужден

3 часа назад
VK WorkSpace для бизнеса: что обсудили на вебинаре с экспертом
На вебинаре Инфостарта менеджер по развитию продаж VK WorkSpace Сергей Кирсанов рассказал о том, как компании используют платформу для корпоративных коммуникаций, какие вопросы возникают при переходе

4 часа назад
Sennheiser представила гарнитура Momentum True Wireless 5 с заменяемой батареей
Немецкая Sennheiser презентовала внутриканальные беспроводные гарнитура Momentum True Wireless 5. Сами гарнитура и их зарядный кейс получили заменяемые аккумуляторы. Замену батарей можно провести при

4 часа назад
Compulsion Games отделяется от XBOX
Генеральный директор Гийом Прово подтвердил, что компания выкупила долю XBOX, сохранила права на интеллектуальную собственность и сохраняет штат сотрудников. Ознакомиться полную новость