OpenAI усилила контроль над своими ИИ‑моделями

3 мин
OpenAI усилила контроль над своими ИИ‑моделями

В OpenAI сообщили, что усиливают контроль над своими ИИ‑моделями после нескольких атак на сторонние сервисы. В частности, компания приостановила разработку некоторых из них.

«Мы хотели уделить необходимое время для достижения новых стандартов, поэтому временно замедлили темпы масштабирования. Это включало двухнедельную паузу в обучении с подкреплением (RL) наших последних моделей, предназначенных для развёртывания, пока мы дополнительно укрепляли и проверяли исследовательские среды на наличие угроз и расширяли охват наших систем мониторинга. Крупнейший запланированный запуск системы обучения с подкреплением (RL) пока приостановлен, пока мы проводим обучение и оценку в меньшем масштабе для анализа поведения моделей, проверки наших мер безопасности и получаем дополнительные доказательства соответствия перед продолжением работы», — говорится в блоге компании.

Свежий решение к разработке более совершенных моделей основан на трёх мерах безопасности:

  • мониторинг, который обнаруживает тревожное поведение и позволяет реагировать на него;

  • согласование, которое снижает вероятность вредоносных или несанкционированных действий;

  • меры безопасности, которые ограничивают доступ или воздействие систем ИИ.

Отмечается, что они применяются в исследованиях и развёртывании, адаптируясь к возможностям каждой модели, операционной среде и уровню риска.

Одновременно компания повышает стандарты безопасности для сред, в которых обучают и оценивают модели. После инцидента с OpenAI‑Hugging Face вывод передовых моделей в исследовательских кластерах для запусков приостановили, чтобы те не могли выполнять код или использовать инструменты, имеющие доступ к интернету. Затем исследователи проработали каждую рабочую нагрузку по отдельности, чтобы определить, можно ли безопасно возобновить её. Некоторые задачи теперь задействуют новые меры контроля.

Компания ввела более строгие требования безопасности для передовых моделей, в том числе:

  • изоляцию рабочих нагрузок в «песочницах». Это равным образом относится к программному обеспечению, которое может быть скомпрометировано во время обработки выходных данных модели;

  • изоляцию сети. Однократная компрометация рабочей нагрузки или вспомогательной службы сама по себе не позволит получить несанкционированный доступ к интернету или другим внутренним сетям;

  • непрерывное тестирование безопасности, чтобы удалить потенциально уязвимые общие службы, уменьшить текущие привилегии и улучшить границы безопасности и доверия. Компания инвестирует в автоматизацию с использованием ИИ для непрерывного тестирования этих границ при имитировании атак.

Новая платформа мониторинга является многоэтапной, начиная с классификаторов активации (детекторов, которые проверяют внутреннюю активность модели), которые запускаются для каждого выбранного токена. Эти системы анализируют действия инструментов, доступные логические рассуждения и полную последовательность действий на предмет несанкционированного доступа, кражи данных, деструктивного поведения и попыток обойти средства защиты. Исследователи стремятся выдавать оповещение в течение 30 минут после обнаружения подозрительной активности.

Это требует значительных вычислительных ресурсов. По текущим оценкам, расходы на мониторинг составляют примерно 20% от общего бюджета вычислительных ресурсов, используемых для вывода.

Для запуска RL на наиболее способных моделях улучшили модели вознаграждений для обнаружения небезопасного поведения; при этом ИИ обучают более честной оценке своих действий, возможностей и ограничений.

«Мы будем развивать нашу структуру готовности, чтобы объединить эти меры безопасности в рамках обучения и развёртывания, а также лучше отражать возможности будущих моделей и среды, в которой они работают. Мы намерены привлекать внешние организации и делиться большей частью полученных знаний по мере развития этого подхода», — заключили в компании.

Ранее OpenAI сообщила о приостановке работы над некоторыми аспектами своей будущей модели Astra после того, как внутренняя проверка выявила значительные успехи в программировании агентов и кибербезопасности — достаточные для того, чтобы вызвать опасения по поводу её возможностей.

Читают сейчас

Сооснователь Anthropic опасается, что Claude постоянно страдать

22 минуты назад

Сооснователь Anthropic опасается, что Claude постоянно страдать

Сооснователь Anthropic и один из ключевых исследователей интерпретируемости моделей Кристофер Олах обсудил с религиозными и философскими исследователями вопрос: может ли современная языковая схема обл

NVIDIA представила AI-компьютер за $4999

2 часа назад

NVIDIA представила AI-компьютер за $4999

NVIDIA анонсировала новую версию настольного AI-компьютера DGX Spark с 64 ГБ объединённой памяти. Продажи начнутся 23 октября через Acer, ASUS, Dell, Gigabyte, HP и MSI. Цена стартует с $4999. Аннотац

Tesla снижает объем RAM в чипах AI5 и AI6

2 часа назад

Tesla снижает объем RAM в чипах AI5 и AI6

Илон Маск сообщил о пересмотре технических характеристик для своих вычислительных платформ AI5 и AI6. Изменения затронули объем внешней оперативной памяти: чип AI5 получит 72 ГБ LPDDR5 вместо ранее за

Выпущен порт файлового менеджера DOS Navigator на Free Pascal

2 часа назад

Выпущен порт файлового менеджера DOS Navigator на Free Pascal

Разработчик Иван Сорокин представил порт файлового менеджера DOS Navigator (оригинальному проекту в этом году исполнилось 35 лет) на Free Pascal. Читать далее

В OpenIDE Pro появилась публичная бета поддержки C#

4 часа назад

В OpenIDE Pro появилась публичная бета поддержки C#

Выпустили публичную бета-версию C#-плагина для OpenIDE Pro. Теперь в IDE можно редактировать и анализировать C#-код, функционировать с .NET-решениями и проектами, собирать, запускать и отлаживать прил