1 августа 2026, 12:17
Google DeepMind представила Gemini Robotics ER 2 — схема для физического ИИ
Google DeepMind выпустила Gemini Robotics ER 2 — новую схема для робототехники, которую компания называет своим самым продвинутым embodied reasoning-решением. ER 2 предназначена для высокоуровневого планирования, работы с непрерывными видеопотоками и координации нескольких роботов в общей физической среде. Модель уже доступна через Gemini api и Google AI Studio, а в Gemini Enterprise Agent Platform открыта в приватном превью.
Основная идея ER 2 — разделение логики и моторики. Модель получает поток текста, аудио или видео, строит план следующих шагов и при этом передает низкоуровневое выполнение отдельным Vision-Language-Action (VLA) моделям или другим инструментам управления. В Google подчеркивают, что такой подход позволяет роботу «думать» о следующем шаге параллельно с выполнением текущих действий, без постоянных пауз на подумать.
Относительно предыдущей версией Gemini Robotics ER 1.6, ER 2 лучше отслеживает прогресс задачи в реальном времени. Схема анализирует непрерывные видеопотоки, умеет определять, на каком этапе находится задача, и может корректировать поведение на лету, если что-то пошло не так. Отдельный акцент сделан на progress classification и moment finding — способности понимать, когда проблема выполнена и в какой именно момент произошло важное событие в кадре.
Google равным образом заявляет о поддержке multi-robot collaboration: разные устройства могут обмениваться семантическим контекстом и совместно выполнять многошаговые задачи. В официальном посте компания демонстрирует примеры с роботами Boston Dynamics Spot, а в репозитории на GitHub опубликованы стартовые примеры для разработчиков, которые хотят попробовать схема в своих сценариях.
Внутри Gemini Robotics ER 2 используются инструменты вроде Google Search и пользовательских функций, а сама модель интегрируется в потоковую архитектуру Gemini Live api для задач с низкой задержкой. По существу, Google строит связку, где крупная мультимодальная модель выступает оркестратором, а специализированные контроллеры и VLA-модели выполняют физические действия.
Стек Google постепенно становится похож на обычный агентский воркфлоу: есть высокоуровневый планировщик, набор инструментов, потоковый ввод данных и отдельный слой исполнения. Google делает ставку на семантическое управление задачей, где схема не только видит мир, но и понимает, на каком этапе находится процедура и как его безопасно довести до конца.
Читают сейчас

1 час назад
OpenAI привлекла сотни сторонних подрядчиков, которые читают и оценивают реальные переписки пользователей с ChatGPT
OpenAI привлекла сотни сторонних подрядчиков, которые читают и оценивают реальные переписки пользователей с ChatGPT для улучшения моделей искусственного интеллекта компании. Об инициативе под кодовым

2 часа назад
Карманный LoRa-коммуникатор ThinkNode M9 с QWERTY-клавиатурой
Компания Elecrow выпустила ThinkNode M9 — компактный коммуникатор для обмена сообщениями без сотовой связи и доступа к интернету. Внешне устройство напоминает старые смартфоны BlackBerry: почти полови

2 часа назад
Gartner: ИИ-компаниям пока нельзя доверять серьёзные задачи бизнеса
За ошибку искусственного интеллекта отвечать будет не тот, кто его разработал, а тот, кто им пользовался. И это уже не догадка, а прямое предупреждение крупнейшей аналитической фирмы, как сообщает The

2 часа назад
«Сбер» показал Time Adapter — надстройку к генеративным моделям для управления динамикой событий и частотой кадров
Команда ИИ-проекта Kandinsky «Сбера» разработала подход под названием Time Adapter. Инициатива предоставляет собой надстройку к генеративным моделям, которая управляет динамикой событий и частотой кад

2 часа назад
В Wizards of the Coast подтвердили: сюжет Warlock будет строго линейным
После триумфа Baldur’s Gate 3 кажется, что абсолютная свобода выбора стала обязательным атрибутом любой фэнтезийной RPG. Larian Studios задала свежий «золотой стандарт», к которому сегодня пытаются пр