Alibaba выпустила мультимодальный ИИ Qwen3.5-Omni — он пишет исходник по видеозаписи экрана

2 мин
Alibaba выпустила мультимодальный ИИ Qwen3.5-Omni — он пишет исходник по видеозаписи экрана

Команда Qwen (Alibaba Cloud) представила Qwen3.5-Omni — новое поколение мультимодальной модели, которая принимает на вход текст, изображения, аудио и видео, а на выходе генерирует текст и речь в реальном времени. Модель выпущена в трех размерах — Plus, Flash и Light — и доступна через Offline программный оболочку и Realtime программный оболочку.

Главное отличие от предшественника Qwen3-Omni — масштаб. Контекстное окно выросло с 32 до 256 тысяч токенов: модель обрабатывает более 10 часов аудио или приблизительно 400 секунд видео 720p за один запрос. Распознавание речи теперь охватывает 113 языков и диалектов (было 19), синтез — 36 (было 10). Оба компонента архитектуры — Thinker и Talker — перешли на Hybrid-Attention MoE, а предобучение проводилось на более чем 100 миллионах часов мультимодальных аудио-видеоданных.

По бенчмаркам версия Plus показала SOTA-результаты на большинстве из 36 аудио- и аудио-видео бенчмарков, а равным образом по десяткам языков в распознавании и переводе речи. В общем и целом аудиопонимании, распознавании, переводе и диалоге схема обошла Gemini 3.1 Pro, а в аудио-видео понимании вышла на его уровень. В генерации речи Qwen3.5-Omni-Plus обогнала ElevenLabs, GPT-Audio и Minimax по стабильности голоса на 20 языках. Текстовые и визуальные способности одновременно не просели — они на уровне текстовых Qwen3.5 того же размера.

Среди новых возможностей — семантическое прерывание (модель отличает реальную реплику пользователя от фонового шума), клонирование голоса, управление скоростью, громкостью и эмоцией речи, а также встроенные WebSearch и FunctionCall. Отдельно Alibaba выделяет технику ARIA (Adaptive Rate Interleave Alignment): она динамически выравнивает текстовые и речевые токены, устраняя пропуски слов и нечёткое произношение чисел при стриминге.

Неожиданным побочным эффектом мультимодального масштабирования стала способность, которую в Alibaba назвали Audio-Visual Vibe Coding: схема смотрит видеозапись экрана с аудиоинструкциями и пишет работающий код — без текстового промпта. В компании подчеркивают, что эту способность не тренировали целенаправленно — она возникла как эмерджентное свойство.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Читают сейчас

Honor представила телефон Robot Phone с роботизированной выдвижной камерой

1 час назад

Honor представила телефон Robot Phone с роботизированной выдвижной камерой

Honor представила Robot Phone с камерой‑гироскопом на задней панели. Он работает с ИИ‑помощником Honor Yoyo, который может наблюдать за окружающей средой и даже взаимодействовать с ней, а равным образ

Куда бежать, если в основе стартапа лежит инженерное подход? Разбираемся на кейсах

2 часа назад

Куда бежать, если в основе стартапа лежит инженерное подход? Разбираемся на кейсах

Спойлер: маленькие инженерные команды все еще могут потягаться с корпорациями. Приглашаем на онлайн паблик-ток с предпринимателями, которые воплотили свои hardware-проекты в действующий бизнес Читать

Выпуск языка программирования Mojo 1.0

2 часа назад

Выпуск языка программирования Mojo 1.0

11 августа 2026 года вышла первая мажорная релиз языка программирования Mojo. Этот выпуск ознаменовал стабилизацию языка и реализацию всех базовых возможностей и оценивается как готовый к повсеместном

7 часов назад

Один день — три громких релиза: Qwen3.8-Max, DeepSeek V4 Pro 0813 и Grok 4.6

На рынке больших языковых моделей сразу некоторое количество заметных обновлений: Alibaba открыла веса гигантской Qwen3.8-Max, DeepSeek выпустила в api версию V4 Pro 0813, а xAI представила Grok 4.6.

Моддер предстаил прототип SteamBoy — Steam Deck в корпусе Game Boy

8 часов назад

Моддер предстаил прототип SteamBoy — Steam Deck в корпусе Game Boy

Реддитор PhyFawkes решил поместить начинку Steam Deck в корпус оригинального Game Boy и представил, что из этого получилось. Читать далее