Astra использует рекуррентную глубину — и это осложняет аудит модели

3 мин

В будущей модели Astra OpenAI использует архитектурный прием recurrent depth, также популярный как looped transformer. Вместо того чтобы каждый слой обрабатывать вход один раз, модель многократно прогоняет представление через одни и те же вычислительные блоки перед генерацией следующего токена. Это даёт возможность увеличить «глубину вычислений» без пропорционального наращивания числа параметров.

У подхода есть два очевидных преимущества. Меньшая по размеру модель может выполнять больше вычислений над сложной задачей, а повторное использование одних и тех же слоев позволяет сократить требования к памяти и пропускной способности по сравнению с простым увеличением размера модели. Исследования подобных методов уже показывали улучшения на задачах программирования и математики.

Но есть и задача с наблюдаемостью размышлений (reasoning). В обычных «думающих» моделях значительная часть рассуждений выражается в виде текстовой цепочки мыслей. При recurrent depth дополнительные вычисления происходят внутри повторяющихся проходов по скрытым представлениям, следовательно значительная часть процесса оказывается менее доступна для внешнего анализа.

Для OpenAI это особенно важно в связи с кибервозможностей Astra. На днях компания заявила, что Astra достигла порога Critical по кибербезопасности согласно Preparedness Framework. По оценке OpenAI, при наличии необходимых инструментов и доступа схема способна находить ранее неизвестные уязвимости и строить способы их эксплуатации в защищенных системах без пошагового руководства человека.

В тестах OpenAI Astra смогла найти и применять две ранее неизвестные уязвимости в контексте exploit chain. В экспертных испытаниях модель также построила цепочку компрометации браузера с выходом из песочницы и выполнением команд на хост-системе.

Поэтому проблема прозрачности здесь не теоретическая. При потенциально критических кибервозможностях исследователям важно быстро понимать, что именно делает схема и почему она это делает. А если часть вычислительного процесса проходит внутри повторных скрытых состояний, обычного анализа chain of thought может оказаться недостаточно.

OpenAI уже развивает дополнительные способы контроля, которые не полагаются только на читаемую цепочку рассуждений. Для Astra компания сочетает мониторинг chain of thought, системные классификаторы, ограничения доступа и механизмы остановки потенциально несанкционированных действий.

Одновременно ситуация с самим обучением уже изменилась. После инцидента с Hugging Face OpenAI действительно приостанавливала часть frontier training приблизительно на две недели и дольше удерживала некоторые крупные RL-запуски. Но 28 августа крупнейший ранее остановленный frontier RL-run для будущих версий Astra был возобновлен после внедрения новых требований к безопасности и изоляции.

Так, recurrent depth дает Astra дополнительный вычислительный бюджет без простого увеличения размера модели, но одновременно усложняет задачу контроля. Чем больше возможностей модель получает внутри скрытых вычислений, тем важнее становится мониторинг, который способен обнаруживать опасное поведение не только по тому, что модель пишет, но и по тому, что она делает.

Читают сейчас

Глубокое море цифровых возможностей — Часть 2. Или как теперь любое судостроительное КБ может стать цифровым

23 минуты назад

Глубокое море цифровых возможностей — Часть 2. Или как теперь любое судостроительное КБ может стать цифровым

Судостроение — одна из самых сложных отраслей по мнению управления данными. И она до сих пор во многом держится на ручном труде. За 4 года мы прошли этот путь сами и теперь готовы поделиться результат

Microsoft прекратит поддержку классических страниц SharePoint с 2027 года

24 минуты назад

Microsoft прекратит поддержку классических страниц SharePoint с 2027 года

С 2027 года Microsoft прекратит поддержку классических страниц SharePoint и отключит создание новых классических сайтов публикации. С 2028 года созданные пользователями классические страницы будут дос

В Chrome 154 Beta появились новые возможности CSS, WebSocket и WebCrypto

38 минут назад

В Chrome 154 Beta появились новые возможности CSS, WebSocket и WebCrypto

Google выпустила бета-версию Chrome 154. В обновлении разработчики получили новые возможности для работы с CSS, веб-api, криптографией и интерфейсами. Среди заметных изменений — плагин возможностей We

Энтузиаст запустил DLSS 5 Neural Rendering для обычной веб-камеры

55 минут назад

Энтузиаст запустил DLSS 5 Neural Rendering для обычной веб-камеры

Разработчик под ником jpneagle опубликовал экспериментальный инициатива, который пропускает изображение с обычной веб-камеры через NVIDIA DLSS 5 Neural Rendering в реальном времени. Исходный код демо

Приглашаем обсудить добавление ИИ-агентов в бизнес

1 час назад

Приглашаем обсудить добавление ИИ-агентов в бизнес

Регистрируйтесь на бесплатный вебинар 10 сентября в 12:00 (мск). Эксперты из Selectel, GlowByte и DataSapience в прямом эфире поговорят про экономику ИИ и растущий тенденция на ИИ-агентов, а также пре