OpenAI выпустила open source-инструменты для повышения безопасности ИИ-приложений для подростков

2 мин
OpenAI выпустила open source-инструменты для повышения безопасности ИИ-приложений для подростков

OpenAI представила набор open source-промптов, которые должны помочь разработчикам создавать ИИ-приложения безопаснее для подростков. Компания предлагает применять их наряду со своей моделью модерации gpt-oss-safeguard, но отмечает, что эти политики можно адаптировать и для других моделей.

Речь идет не о готовом приложении, а о наборе правил, которые помогают заранее задать границы допустимого поведения ИИ. В них затрагиваются темы графического насилия, сексуального контента, опасных челленджей, вредных представлений о теле, романтического или агрессивного ролевого взаимодействия, а также товаров и услуг с возрастными ограничениями.

Другие новости и материалы по AI — в Telegram-канале NH | Новости технологий, AI и будущее. 

В OpenAI объясняют, что даже опытным командам сложно перевести общие цели безопасности в точные и рабочие правила. В результате защита часто получается либо непоследовательной, либо слишком размытой, либо, наоборот, чрезмерно жесткой. Новый набор промптов должен дать разработчикам базовый каркас, который можно дорабатывать под свой продукт.

Над этими политиками OpenAI работала вместе с организациями Common Sense Media и everyone.ai. В компании подчеркивают, что это не полноценное решение всех проблем AI safety, а скорее минимальный практический уровень защиты, который можно быстро встроить в продукт.

На фоне растущего внимания к тому, как ИИ взаимодействует с несовершеннолетними, такой шаг выглядит логичным. Особенно для небольших команд, у которых нет собственных ресурсов на разработку сложной системы модерации с нуля.

Читают сейчас

Манипуляция агентами: эксплуатация уязвимостей в репозитории Google Agent Development Kit

6 часов назад

Манипуляция агентами: эксплуатация уязвимостей в репозитории Google Agent Development Kit

Исследователи Pillar Security зафиксировали первый случай использования одного ИИ-агента другим в реальном продакшен-окружении. Уникальная на данный момент уязвимость была найдена в google/adk-python

OpenAI замедлила разработку модели Astra

8 часов назад

OpenAI замедлила разработку модели Astra

OpenAI сообщила о приостановке работы над некоторыми аспектами своей будущей модели Astra после того, как внутренняя проверка выявила значительные успехи в программировании агентов и кибербезопасности

Исследователи взломали детские умные часы и показали, что можно следить за их владельцем

8 часов назад

Исследователи взломали детские умные часы и показали, что можно следить за их владельцем

Исследователи в области кибербезопасности взломали детские смарт‑часы от китайской компании YiQingTeng Electronics и показали, как можно следить за их владельцем. Репортёр Wired Энди Гринберг использо

Cloudflare опубликовал браузер Kitesurf для ИИ‑агентов

9 часов назад

Cloudflare опубликовал браузер Kitesurf для ИИ‑агентов

Cloudflare запустила Kitesurf — облачный браузер, разработанный специально для агентов искусственного интеллекта. Разработчики ИИ смогут создавать программное обеспечение, способное перемещаться по ве

Организация Framework уведомила всех клиентов об утечке данных

9 часов назад

Организация Framework уведомила всех клиентов об утечке данных

Организация Framework, производящая модульные ремонтопригодные компьютеры, сообщила, что уведомила всех клиентов о краже их имён, адресов электронной почты, номеров телефонов и физических адресов. Уте