2 часа назад
OpenClaw-RL обучает ИИ-агентов в реальном времени, просто говоря с ними

До недавнего времени все взаимодействия с нейросетью использовались только как контекст для следующего шага – и тут же забывались. Команда ученых из Принстона посчитала такой подход системной ошибкой и разработала архитектуру, которая превращает эти мимолетные сигналы в тренировочный материал. Каркас не делает различий между личной перепиской, работой в командной строке, задачами по разработке ПО или вызовами инструментов – все стекается в один конвейер для улучшения единой модели.

Согласно заявлению исследователей, в этих постсигналах скрыты два типа информации, которые ранее игнорировались. Первый – оценочный. Если потребитель переспрашивает то же самое, схема фиксирует неудовлетворенность. Если автоматический проверка проходит – действие было верным. Сигналы становятся естественной оценкой качества каждого шага без необходимости ручной разметки. Прежние методы в лучшем случае использовали такие данные постфактум, выуживая их из заранее собранных датасетов.
Второй тип – направляющий. Когда человек пишет “Надо было сначала проверить файл”, эта реплика содержит не просто оценку (“плохо”), а конкретное указание, что именно следовало сделать иначе. Обычные системы обучения с подкреплением сжимают такую обратную связь в обычное число (награду), теряя по дороге всю содержательную часть.

Архитектура OpenClaw-RL разбита на четыре несвязанных блока: один обслуживает запросы к модели, второй управляет окружениями, третий оценивает качество ответов, а четвертый занимается непосредственно тренировкой весов. Ни один из них не ждет другой: модель отвечает на второй запрос пользователя в тот момент, когда модель-оценщик анализирует предыдущий ответ, а тренировочный модуль параллельно обновляет веса.
Исследователи проверили OpenClaw-RL на модели Qwen3-4B в двух симулированных сценариях. В первом языковая схема играла студента, который использует OpenClaw для домашних заданий, но не хочет, чтобы его распознали как ИИ. Во втором – преподавателя, которому нужен определённый фидбек по работам.

В сценарии со студентом метрика персонализации подскочил с 0,17 до 0,76 всего за восемь шагов обучения при комбинированном методе. Binary RL в одиночку достиг только 0,25, и OPD в одиночку равным образом представил 0,25 после восьми шагов, но догнал до 0,72 после 16 шагов. В сценарии с учителем оценка выросла с 0,22 до 0,90.
Для общих агентов каркас протестировали с разными версиями Qwen3 на задачах с командной строкой, графическим интерфейсом, разработкой ПО и вызовом инструментов. И здесь интеграция добавочных оценок помогла. В сценарии с вызовами инструментов точность выросла с 0,17 до 0,30, а для графического интерфейса – с 0,31 до 0,33.

Исследователи утверждают, что их каркас – первая платформа, объединяющая несколько одновременных потоков взаимодействия (от личных разговоров до задач разработки) в едином тренировочном цикле. Исходный код доступен на GitHub.
Хотя принстонский проект использует название популярного открытого AI-агента OpenClaw и опирается на его инфраструктуру, это независимое исследование, уже не связанное напрямую с основной командой платформы. Основатель OpenClaw Питер Штайнбергер передал проект в фонд и перешел в OpenAI для работы над следующим поколением персональных AI-агентов.
Читают сейчас

16 минут назад
В Роспатент поступила заявка на регистрацию товарного знака на фразу «Сохранить как» от «Яндекса»
13 марта 2026 года в Роспатент 13 поступила заявка на регистрацию товарного знака, представляющего собой фразу «Сохранить как». Заявителем заявки выступила организация «Яндекс». Ознакомиться далее

29 минут назад
О чем молчат тимлиды: свежий сезон «Свободного слота»
Подкаст «Свободный слот» возвращается после каникул. В студии — Александра Прокшина, Паша Федотов и Саша Афёнов. В первом выпуске ребята разбираются, почему тимлид может чувствовать себя одиноко, даже
33 минуты назад
Российские мессенджеры требуют от государства таких же преференций, как у Max
Несколько российских мессенджеров ведут борьбу за то, чтобы получить от властей такие же права, как у Max. Об этом рассказал председатель совета Фонда развития виртуальный экономики Герман Клименко в

39 минут назад
Manus⚹ выходит из облака и садится за рабочий стол: что умеет “My Computer”
До сегодняшнего дня Manus⚹ обитал исключительно в облаке. Песочница с доступом в интернет, командной строкой, файловой системой и браузером была для него идеальной средой – безопасной и всегда готовой

50 минут назад
Правительство РФ утвердило дорожную карту по развитию суперкомпьютерной инфраструктуры в стране
Правительство России утвердило дорожную карту по развитию высокопроизводительных вычислений и суперкомпьютерной инфраструктуры. Распоряжение подписал Председатель Правительства Михаил Мишустин. В конт