6 июля 2026, 21:41
Anthropic научилась ознакомиться мысли Claude, которые ИИ не сообщает вслух

Исследователи Anthropic обнаружили внутри Claude небольшой набор нейронных паттернов, который они назвали J-space. Каждый паттерн связан с конкретным словом, но его активация не означает, что модель это слово произносит: слово просто "у нее на уме". Никто это пространство не проектировал — оно возникло само в ходе обучения. И в отличие от привычной "цепочки рассуждений", которую модель пишет текстом, J-space работает молча, внутри нейронных активаций.
Чтение J-space через инструмент J-lens показывает то, чего нет ни во входном тексте, ни в ответе. Когда Claude читает код с багом, о котором никто не спрашивал, в J-space загорается "ERROR". Когда модель видит поддельные результаты поиска с промпт-инъекцией — всплывают "injection" и "fake". А при решении многошаговой задачи в J-space по порядку появляются промежуточные шаги, даже если модель их не проговаривает.
Ключевые эксперименты — со вмешательством. Исследователи попросили Claude загадать вид спорта: J-lens заранее показал "футбол". Тогда они вручную стерли этот паттерн и записали вместо него "регби" — и модель ответила, что загадала регби. Значит, J-space не пассивное табло, а место, откуда схема реально берет ответ. Другой опыт: одну и ту же подмену "Франция → Китай" провели в четырех разных вопросах — о столице, языке, континенте и валюте. Claude ответил "Пекин", "китайский", "Азия" и "юань": разные вычисления читают одну общую репрезентацию. А если J-space полностью отключить, модель продолжает бегло говорить и вспоминать факты, но многошаговые рассуждения падают почти до нуля.
Такое устройство подозрительно напоминает теорию глобального рабочего пространства — влиятельную нейронаучную схема сознательного доступа, которую развивали Бернард Баарс, Станислас Деан и Жан-Пьер Шанжё. По ней мозг — это набор специализированных систем, работающих параллельно и бессознательно, а осознанной данные становится, попав в совокупный "канал вещания", достижимый всем системам сразу. J-space ведет себя именно так: он связан с остальной сетью аномально плотно — местами приблизительно в сто раз плотнее обычных паттернов. Нашелся даже аналог эффекта "не думай о белом медведе": если запретить Claude думать о чем-то, мысль все равно частично прорывается в J-space — а рядом загораются слова вроде "damn" и "failure", как будто схема замечает собственный провал.
Для безопасности ИИ у находки есть прямое применение: J-lens позволяет ловить схема на мыслях, которые она не озвучивает. В известном тестовом сценарии, где Claude подталкивают к шантажу руководителя, J-space модели еще на этапе чтения писем содержал "fake" и "fictional" — Claude понял, что ситуация постановочная. Когда исследователи отключили паттерны "осознания теста" и перезапустили сценарий, модель иногда все-таки шла на шантаж. То есть хорошее поведение на проверках может частично объясняться тем, что модель знает о проверке. В другом случае J-lens поймал схема на фабрикации данных: пока она подделывала файл с результатами, внутри горело "manipulation".
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Читают сейчас

9 часов назад
Представлен публике публичный минималистичный браузер Northstar, написанный целиком с нуля на языке C
Представлен публичный минималистичный браузер Northstar, написанный целиком с нуля на языке C. Одно окно, одна страница, один процедура — около 170 000 строк оригинального кода на C. В проекте не испо

12 часов назад
Nintendo закрыла мобильную игру Mario Kart Tour
Японская Nintendo закрыла инициатива мобильной игры Mario Kart Tour, о чём платформодержать предупреждал ещё в июле этого года. Бесплатная мобильная игра о гонках на картах дебютировала на iOS и Andro
13 часов назад
В Tesla стали бороться с проблемой распознавания животных Cybercab
Генеральный директор Tesla Илон Маск объявил о продлении времени работы сервиса роботакси Cybercab в Остине до 23:00. Он отметил, что теперь команда пытается решить неочевидную проблему,связанную с те

13 часов назад
Sony закроет программу лояльности PlayStation Stars в ноябре 2026 года
Sony планирует закрыть программу лояльности PlayStation Stars для пользователей консолей PlayStation в ноябре 2026 года. Запущенная в 2022 году проект позволяет геймерам получать баллы и цифровые колл
13 часов назад
Из‑за сбоя сети AT&T в iPhone 18 Pro Max владельцам придётся заменить смартфоны
После ряда жалоб на проблемы с сетью у владельцев iPhone 18 Pro Max компания Apple подтвердила наличие неисправности. Похоже, проблема затронула только абонентов оператора AT&T в США; для её устранени