1 час назад
Google DeepMind представила Gemini Robotics ER 2 — схема для физического ИИ
Google DeepMind выпустила Gemini Robotics ER 2 — новую схема для робототехники, которую компания называет своим самым продвинутым embodied reasoning-решением. ER 2 предназначена для высокоуровневого планирования, работы с непрерывными видеопотоками и координации нескольких роботов в общей физической среде. Модель уже доступна через Gemini api и Google AI Studio, а в Gemini Enterprise Agent Platform открыта в приватном превью.
Основная идея ER 2 — разделение логики и моторики. Модель получает поток текста, аудио или видео, строит план следующих шагов и при этом передает низкоуровневое выполнение отдельным Vision-Language-Action (VLA) моделям или другим инструментам управления. В Google подчеркивают, что такой подход позволяет роботу «думать» о следующем шаге параллельно с выполнением текущих действий, без постоянных пауз на подумать.
Относительно предыдущей версией Gemini Robotics ER 1.6, ER 2 лучше отслеживает прогресс задачи в реальном времени. Схема анализирует непрерывные видеопотоки, умеет определять, на каком этапе находится задача, и может корректировать поведение на лету, если что-то пошло не так. Отдельный акцент сделан на progress classification и moment finding — способности понимать, когда проблема выполнена и в какой именно момент произошло важное событие в кадре.
Google равным образом заявляет о поддержке multi-robot collaboration: разные устройства могут обмениваться семантическим контекстом и совместно выполнять многошаговые задачи. В официальном посте компания демонстрирует примеры с роботами Boston Dynamics Spot, а в репозитории на GitHub опубликованы стартовые примеры для разработчиков, которые хотят попробовать схема в своих сценариях.
Внутри Gemini Robotics ER 2 используются инструменты вроде Google Search и пользовательских функций, а сама модель интегрируется в потоковую архитектуру Gemini Live api для задач с низкой задержкой. По существу, Google строит связку, где крупная мультимодальная модель выступает оркестратором, а специализированные контроллеры и VLA-модели выполняют физические действия.
Стек Google постепенно становится похож на обычный агентский воркфлоу: есть высокоуровневый планировщик, набор инструментов, потоковый ввод данных и отдельный слой исполнения. Google делает ставку на семантическое управление задачей, где схема не только видит мир, но и понимает, на каком этапе находится процедура и как его безопасно довести до конца.
Читают сейчас

2 часа назад
Буст задержек DDR5: MSI заявляет, что High-Efficiency Mode нивелирует разницу с EXPO ULL
Компания MSI анонсировала внедрение фирменной технологии High-Efficiency Mode для материнских плат с AM5. Опция предназначена для автоматической оптимизации субтаймингов на DDR5 с поддержкой профилей

6 часов назад
Представлен публике публичный инициатива Decimen Optical Transfer для передачи файлов между смартфонами через QR-коды
Разработчик Bash Alarmist представил публичный инициатива под названием Decimen Optical Transfer. Это решение для передачи файлов между двумя устройствами с использованием только экрана и камеры через

7 часов назад
Версия открытой платформы для самостоятельного хранения и управления фото и видео Immich 3.1
В конце июля 2026 года состоялся версия обновления открытой платформы для самостоятельного хранения и управления фото и видео Immich 3.1. Инициатива находится в разработке с начала 2022 года и опублик

7 часов назад
Выпуск гипервизора Xen 4.22
30 июля 2026 года состоялся выпуск гипервизора Xen 4.22. Исходный код проекта написан на языке С и опубликован под лицензией GPLv2+. Создание решения ведётся в составе организации Linux Foundation при

17 часов назад
Counter-Strike: Global Offensive стал доступен для запуска в браузере
Энтузиаст под ником slqnt, который до этого работал на проектом браузерного Half‑Life 2, выложил инициатива в открытый доступ инициатива CS:GO Webport — Counter‑Strike: Global Offensive в браузере. Чи