6 июля 2026, 21:41
Anthropic научилась ознакомиться мысли Claude, которые ИИ не сообщает вслух

Исследователи Anthropic обнаружили внутри Claude небольшой набор нейронных паттернов, который они назвали J-space. Каждый паттерн связан с конкретным словом, но его активация не означает, что модель это слово произносит: слово просто "у нее на уме". Никто это пространство не проектировал — оно возникло само в ходе обучения. И в отличие от привычной "цепочки рассуждений", которую модель пишет текстом, J-space работает молча, внутри нейронных активаций.
Чтение J-space через инструмент J-lens показывает то, чего нет ни во входном тексте, ни в ответе. Когда Claude читает код с багом, о котором никто не спрашивал, в J-space загорается "ERROR". Когда модель видит поддельные результаты поиска с промпт-инъекцией — всплывают "injection" и "fake". А при решении многошаговой задачи в J-space по порядку появляются промежуточные шаги, даже если модель их не проговаривает.
Ключевые эксперименты — со вмешательством. Исследователи попросили Claude загадать вид спорта: J-lens заранее показал "футбол". Тогда они вручную стерли этот паттерн и записали вместо него "регби" — и модель ответила, что загадала регби. Значит, J-space не пассивное табло, а место, откуда схема реально берет ответ. Другой опыт: одну и ту же подмену "Франция → Китай" провели в четырех разных вопросах — о столице, языке, континенте и валюте. Claude ответил "Пекин", "китайский", "Азия" и "юань": разные вычисления читают одну общую репрезентацию. А если J-space полностью отключить, модель продолжает бегло говорить и вспоминать факты, но многошаговые рассуждения падают почти до нуля.
Такое устройство подозрительно напоминает теорию глобального рабочего пространства — влиятельную нейронаучную схема сознательного доступа, которую развивали Бернард Баарс, Станислас Деан и Жан-Пьер Шанжё. По ней мозг — это набор специализированных систем, работающих параллельно и бессознательно, а осознанной данные становится, попав в совокупный "канал вещания", достижимый всем системам сразу. J-space ведет себя именно так: он связан с остальной сетью аномально плотно — местами приблизительно в сто раз плотнее обычных паттернов. Нашелся даже аналог эффекта "не думай о белом медведе": если запретить Claude думать о чем-то, мысль все равно частично прорывается в J-space — а рядом загораются слова вроде "damn" и "failure", как будто схема замечает собственный провал.
Для безопасности ИИ у находки есть прямое применение: J-lens позволяет ловить схема на мыслях, которые она не озвучивает. В известном тестовом сценарии, где Claude подталкивают к шантажу руководителя, J-space модели еще на этапе чтения писем содержал "fake" и "fictional" — Claude понял, что ситуация постановочная. Когда исследователи отключили паттерны "осознания теста" и перезапустили сценарий, модель иногда все-таки шла на шантаж. То есть хорошее поведение на проверках может частично объясняться тем, что модель знает о проверке. В другом случае J-lens поймал схема на фабрикации данных: пока она подделывала файл с результатами, внутри горело "manipulation".
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Читают сейчас

4 часа назад
TG Notion: добавлен английский язык интерфейса
В боте появился английский язык. Теперь все элементы Mini App — вкладки, кнопки, формы, меню — можно переключить на английский. Как это работает: Ознакомиться далее

4 часа назад
Goldman Sachs: ИИ уничтожает рабочие места быстрее, чем создаёт их
Исследование Goldman Sachs показало: искусственный интеллект приводит к потере нескольких тысяч рабочих мест в месяц, и вакансии, которые появляются благодаря ИИ, не могут заполнить этот разрыв. Согла

5 часов назад
Binance разрешила ИИ‑агентам торговать
Криптобиржа Binance запустила платформу, где ИИ‑агенты могут анализировать рынки и совершать сделки от имени пользователей. Служба, получивший название Agent OS, включает программный интерфейс Binance

6 часов назад
Карта GeForce RTX 3070 некоторое количество лет работала с постоянным перегревом из‑за неправильной заводской сборки
Владельцу GeForce RTX 3070 удалось выяснить, почему его графика постоянно перегревается. Спустя почти пять лет с момента покупки он обнаружил, что сборщики не сняли защитную прозрачную плёнку с термоп

6 часов назад
Asana за две недели заменила систему тестирования при помощи Codex от OpenAI
Asana за две недели заменила устаревшую систему тестирования, используя Codex от OpenAI. Компании это обошлось примерно в $12 000 против $6 млн согласно предыдущему плану обновления. Читать далее