1 час назад
OpenAI усилила контроль над своими ИИ‑моделями
В OpenAI сообщили, что усиливают контроль над своими ИИ‑моделями после нескольких атак на сторонние сервисы. В частности, компания приостановила разработку некоторых из них.
«Мы хотели уделить необходимое время для достижения новых стандартов, поэтому временно замедлили темпы масштабирования. Это включало двухнедельную паузу в обучении с подкреплением (RL) наших последних моделей, предназначенных для развёртывания, пока мы дополнительно укрепляли и проверяли исследовательские среды на наличие угроз и расширяли охват наших систем мониторинга. Крупнейший запланированный запуск системы обучения с подкреплением (RL) пока приостановлен, пока мы проводим обучение и оценку в меньшем масштабе для анализа поведения моделей, проверки наших мер безопасности и получаем дополнительные доказательства соответствия перед продолжением работы», — говорится в блоге компании.
Свежий решение к разработке более совершенных моделей основан на трёх мерах безопасности:
мониторинг, который обнаруживает тревожное поведение и позволяет реагировать на него;
согласование, которое снижает вероятность вредоносных или несанкционированных действий;
меры безопасности, которые ограничивают доступ или воздействие систем ИИ.
Отмечается, что они применяются в исследованиях и развёртывании, адаптируясь к возможностям каждой модели, операционной среде и уровню риска.
Одновременно компания повышает стандарты безопасности для сред, в которых обучают и оценивают модели. После инцидента с OpenAI‑Hugging Face вывод передовых моделей в исследовательских кластерах для запусков приостановили, чтобы те не могли выполнять код или использовать инструменты, имеющие доступ к интернету. Затем исследователи проработали каждую рабочую нагрузку по отдельности, чтобы определить, можно ли безопасно возобновить её. Некоторые задачи теперь задействуют новые меры контроля.
Компания ввела более строгие требования безопасности для передовых моделей, в том числе:
изоляцию рабочих нагрузок в «песочницах». Это равным образом относится к программному обеспечению, которое может быть скомпрометировано во время обработки выходных данных модели;
изоляцию сети. Однократная компрометация рабочей нагрузки или вспомогательной службы сама по себе не позволит получить несанкционированный доступ к интернету или другим внутренним сетям;
непрерывное тестирование безопасности, чтобы удалить потенциально уязвимые общие службы, уменьшить текущие привилегии и улучшить границы безопасности и доверия. Компания инвестирует в автоматизацию с использованием ИИ для непрерывного тестирования этих границ при имитировании атак.
Новая платформа мониторинга является многоэтапной, начиная с классификаторов активации (детекторов, которые проверяют внутреннюю активность модели), которые запускаются для каждого выбранного токена. Эти системы анализируют действия инструментов, доступные логические рассуждения и полную последовательность действий на предмет несанкционированного доступа, кражи данных, деструктивного поведения и попыток обойти средства защиты. Исследователи стремятся выдавать оповещение в течение 30 минут после обнаружения подозрительной активности.
Это требует значительных вычислительных ресурсов. По текущим оценкам, расходы на мониторинг составляют примерно 20% от общего бюджета вычислительных ресурсов, используемых для вывода.
Для запуска RL на наиболее способных моделях улучшили модели вознаграждений для обнаружения небезопасного поведения; при этом ИИ обучают более честной оценке своих действий, возможностей и ограничений.
«Мы будем развивать нашу структуру готовности, чтобы объединить эти меры безопасности в рамках обучения и развёртывания, а также лучше отражать возможности будущих моделей и среды, в которой они работают. Мы намерены привлекать внешние организации и делиться большей частью полученных знаний по мере развития этого подхода», — заключили в компании.
Ранее OpenAI сообщила о приостановке работы над некоторыми аспектами своей будущей модели Astra после того, как внутренняя проверка выявила значительные успехи в программировании агентов и кибербезопасности — достаточные для того, чтобы вызвать опасения по поводу её возможностей.
Читают сейчас
17 минут назад
Polaroid и The Pokémon Company представили коллекцию камер и аксессуаров
Polaroid и бренд The Pokémon Company объединились для создания лимитированной коллекции камер моментальной съёмки, плёнки и аксессуаров. Они выполнены в виде популярных покемонов, в том числе Пикачу,

28 минут назад
Nokia планирует закрыть почти все заводы в материковом Китае к концу 2026 года
Финская Nokia планирует поэтапно закрыть почти все свои заводы и сократить большую часть персонала в материковом Китае к концу 2026 года, пишет South China Morning Post со ссылкой на источники. По сос
36 минут назад
Аппарат НАСА LRO сделал фото кратера на Луне после падения следующий ступени Falcon 9
В период с 11 по 12 августа орбитальный аппарат НАСА Lunar Reconnaissance Orbiter (LRO) сделал серию снимков нового кратера на Луне. Он образовался 5 августа после падения верхней ступени ракеты Space

48 минут назад
INTEKEY и Яндекс Роботикс заключили сотрудничество для роботизации складов
Компания INTEKEY начала партнёрство с Яндекс Роботикс. Партнёрство позволит клиентам INTEKEY применять роботизированное решение «Кубик» для комплектации заказов с интеграцией в систему управления скла
56 минут назад
Гендиректор Grindr: эффективность инженеров выросла в 3,5 раза благодаря ИИ
Гендиректор проекта Grindr Джордж Арисон заявил, что с июля 2025 года по апрель 2026-го производительность инженерной команды выросла в 3,5 раза при «минимальном росте» самого штата разработчиков. Он