10 августа 2026, 18:37
Qwen релизнули мультимодальный tool layer для ИИ‑агентов

Команда Qwen выпустила Qwen‑MM‑Plugins — публичный мультимодальный tool layer, который позволяет подключать зрение, OCR, обработку видео и аудио к любому агентному окружению в виде отдельных плагинов. Вместо того чтобы жестко встраивать мультимодальность в конкретную схема, Qwen предлагает сделать набор специализированных инструментов, которые агент может юзать по мере необходимости.
Агент, запущенный в Claude Code, Codex, Qwen Code, Gemini CLI, Qoder, OpenClaw или другом совместимом тестовом окружении, получает доступ к коллекции мультимодальных способностей (capabilities) и использует их как обычные инструменты внутри длинного воркфлоу. Репозиторий устроен именно как набор отдельных модулей, которые можно устанавливать независимо друг от друга.
На старте базовый расширение предоставляет:
чтение изображений;
аналитика видео;
работу с документами и 3D‑моделями;
OCR;
object grounding;
сегментацию;
транскрибацию речи;
кадрирование и другие операции.
Вместо привычной схемы: агент → одна мультимодальная схема, получается более гибкая архитектура: агент → набор специализированных мультимодальных инструментов → цепочка действий.
В частности, агент может сначала проанализировать изображение, затем найти необходимый объект, вырезать конкретную область, выполнить OCR, сопоставить результат с видеороликом, транскрибировать аудио и собрать все полученные информация в единый ответ.
По сути, Qwen пытается сделать, простите за тавтологию — мультимодальность действительно модульной. Не нужно переходить на отдельный рантайм или новую агентную платформу — в достаточной степени установить необходимый capability, после чего агент сможет применять его как обычный инструмент. Это должно быть особенно удобно для длинных агентных сценариев, где требуется последовательно комбинировать некоторое количество разных операций над изображениями, видео, документами и аудио.
Проект распространяется по лицензии Apache 2.0, а репозиторий уже содержит примеры интеграции с популярными агентными средами и готовые cookbook‑сценарии для работы с Qwen3.8-Max. Ссылка на GitHub.
Читают сейчас
6 часов назад
OpenAI добавила плагины в голосовой режим ChatGPT
OpenAI расширила возможности Live Voice в ChatGPT: теперь во время голосового разговора можно применять подключённые плагины и приложения. Функция доступна в веб-версии, а также на iOS и Android. Асси

7 часов назад
Учёные выдвинули теорию о тёмных измерениях и первичных чёрных дырах
Все мы заперты в трёх привычных пространственных и одном временном измерении, однако это не означает, что гравитация не может проникать в другие измерения, если они существуют. И у нас может появиться

7 часов назад
DrivingBench проверили GPT-6 Astra, GPT-5.6 Sol, Grok 4.6 и Claude Fable 5.1 на функция управлять авто
Исследователи из DrivingBench проверили, как современные нейросети умеют водить автомобиль. В контексте этого проекта ИИ-системы OpenAI GPT-6 Astra и GPT-5.6 Sol, SpaceXAI Grok 4.6 и Anthropic Claude

8 часов назад
Гига Писарь теперь и на Windows
В прошлой статье я подвёл итоги первых полутора недель и повесил опрос. По итогам голосования я понял, что у большинства не мак, могу предположить, что Винда. Так что спустя пару дней я запилил Писаря

9 часов назад
Beyond Good & Evil 2 все еще жива: создание продолжается спустя 18 лет после анонса
Долгострой Beyond Good & Evil 2 продолжает подавать признаки жизни. Ведущий сценарист и помощник нарративного директора Ubisoft Bordeaux Рик Годвин рассказал, что последние некоторое количество месяце