AIRI показал ELMUR — архитектуру памяти для роботов на базе ИИ

2 мин
AIRI показал ELMUR — архитектуру памяти для роботов на базе ИИ

Ученые института AIRI представили ELMUR — архитектуру управления для роботов и ИИ-агентов, которым нужно принимать решения с учетом событий из далекого прошлого. Это важная задача для робототехники: агент может увидеть полезную информацию задолго до того, как она понадобится для действия.

Обычные трансформеры с этой задачей справляются ограниченно. Если расширять окно внимания, резко растут вычислительные затраты. Если сжимать прошлый опыт, появляется риск потерять важные детали. А внешняя память фиксированного размера не всегда позволяет надежно учитывать давние события при текущем решении.

В ELMUR хранилище встроена прямо в слои модели. Каждый слой содержит фиксированное количество слотов, которые параллельно взаимодействуют с основным потоком данных. Система может читать нужную информацию из этих ячеек и записывать туда новые информация. Если память заполняется, обновляются те слоты, которые использовались реже всего, по принципу LRU — Least Recently Used.

Такой подход даёт возможность агенту хранить важные данные за пределами обычного окна внимания без квадратичного роста вычислений. По словам исследователей, ELMUR может удерживать полезную информацию на протяжении 100 тыс. шагов вне стандартного контекста.

В тестах архитектура показала заметный итог. В синтетическом T-Maze схема смогла удерживать информацию в течение одного миллиона шагов со 100-процентной точностью. На бенчмарке MIKASA-Robo, который оценивает хранилище роботов, ELMUR почти вдвое улучшила базовые показатели и заняла первое место в 21 из 23 задач.

Главная область применения — робототехника и системы управления, где агент получает неполные визуальные сигналы и должен действовать в среде, которая меняется со временем. Например, робот может заметить объект, препятствие или подсказку в начале маршрута, а применять эту информацию только спустя множество шагов.

Следующим этапом исследователи хотят расширить подход на Visual Language Action-модели. Это направление особенно важно для роботов, которые связывают визуальное восприятие, языковые инструкции и физические действия.

Читают сейчас

Hugging Face выпустила ML Intern — агента для обучения и публикации моделей

1 час назад

Hugging Face выпустила ML Intern — агента для обучения и публикации моделей

Hugging Face добавила в HuggingChat AI‑агента ML Intern для задач, связанных с машинным обучением. В компании его описывают как автономного ML‑инженера: потребитель формулирует задачу на естественном

Разработчик опубликовал утилиту Glance для разблокировки MacBook с помощью веб‑камеры

1 час назад

Разработчик опубликовал утилиту Glance для разблокировки MacBook с помощью веб‑камеры

Разработчик Джонатан Чжоу (Jonathan Zhou) выпустил Glance — утилиту с открытым кодом для разблокировки MacBook с помощью веб‑камеры. Приложение сравнивает снимок лица пользователя с его эмбеддингами в

LG отрицает, что следит за пользователями своих умных телевизоров

2 часа назад

LG отрицает, что следит за пользователями своих умных телевизоров

Представители LG ответили на исследование GamersNexus и Level1Techs о том, что компания собирает слишком много пользовательских данных. По словам компании, сбор информации идёт только с разрешения пол

OpenAI приостановит дизайн новых подписок ChatGPT Pro в связи с спроса на Astra

2 часа назад

OpenAI приостановит дизайн новых подписок ChatGPT Pro в связи с спроса на Astra

После запуска GPT-6 Astra OpenAI столкнулась с рекордным спросом на новую модель. Об этом сообщил Тибо Сотью. По его словам, интерес к Astra превысил все предыдущие исторические показатели сервиса. Сп

Обогнав Болта, китайский робот‑чемпион готовится к работе в реальном мире

4 часа назад

Обогнав Болта, китайский робот‑чемпион готовится к работе в реальном мире

Через неделю после того, как его робот обогнал самого быстрого человека в мире, Джек Го уже взялся за более сложную задачу. TianGong Ultra поразил зрителей Всемирных игр человекоподобных роботов, проб