14 июля 2026, 15:00
Сбер открыл исходник GigaAM Multilingual и GigaChat Audio
Сбер выложил в открытый доступ сразу две модели, связанные с аудио: семейство для распознавания речи GigaAM Multilingual и большую языковую модель GigaChat Audio, которая умеет работать с голосом напрямую. Решение опубликовано на Hugging Face и GitHub под лицензией MIT.
GigaAM Multilingual — открытый ASR, который обходит Whisper
GigaAM Multilingual включает аудиоэнкодер с самостоятельным обучением и многоязычную CTC ASR-модель. Это первая российская открытая мультиязычная схема распознавания речи.
Аудиоэнкодер предварительно обучен на 2 млн часов речи на 70+ языках с фокусом на страны СНГ, что ускоряет адаптацию к новым языкам. Многоязычная схема дообучена на 50 тыс. часов мультидоменной речи.
По заявлению Сбера, количество ошибок у GigaAM в 1,5–2 раза ниже, чем у ближайших аналогов. Компактная версия с 240 млн параметров обгоняет Whisper Large v3 и Omnilingual 1B.
Сейчас схема поддерживает русский, английский, казахский, киргизский и узбекский. Доступна в двух вариантах: компактном для стандартных процессоров и флагманском с более высоким качеством. В сообществе уже появились порты для Apple Silicon — в частности, MLX-версия даёт 180-кратный прирост в реальном времени на M2 Max.
GigaChat Audio
GigaChat Audio объединяет возможности GigaAM Multilingual и GigaChat 3.1. Она работает с аудио напрямую, без предварительной транскрибации, анализируя интонацию, тембр и произношение.
Ключевые возможности:
Распознавание эмоций — точность 80% по внутренним тестам, что выше Qwen3-Omni-30B (70%) и Kimi-Audio (62%).
Обработка длинных записей — до трёх часов, контекст — до двух часов.
Поиск по аудио — пересказ фрагментов с таймкодами, ответы на вопросы по содержанию.
DIARIZATION — различает голоса разных спикеров.
Долговременная хранилище — запоминает факты из голосовых диалогов для будущих сессий (управляется пользователем).
В бенчмарке Arena Hard Audio модель показала 75 процентов побед в «слепых» сравнениях, приблизившись к Gemini-3-Flash-preview (77,5%) и опередив Gemini 2.5 Pro (62%). Для российской LLM это действительно прорывной итог. Для разработчиков доступна облегчённая версия GigaChat3.1-Audio-10B.
GigaAM Multilingual на Hugging Face
GigaAM Multilingual на GitHub
GigaChat Audio на Hugging Face
GigaChat на
Читают сейчас

4 часа назад
Prusa представила PrusaSlicer 3.0 с новым интерфейсом и поддержкой плагинов
Команда Prusa Research выпустила первую публичную альфа‑версию слайсера PrusaSlicer 3.0. Авторы переписали интерфейс, переработали систему профилей, добавили поддержку полноценной работы с несколькими

4 часа назад
Anthropic обновила Claude – вышли Fable 5.1 и Mythos 5.1
Anthropic выпустила апдейт своих топовых моделей – Claude Fable 5.1 и Claude Mythos 5.1. Это одна и та же модель под капотом, различающаяся уровнем защитных ограничений: Fable 5.1 доступна всем в цело

4 часа назад
Creality представила 3D‑принтер SPARKX i8 с поддержкой многоцветной печати и быстрой сменой филамента
Creality представила 3D‑принтер SPARKX i8 с поддержкой четырёхцветной печати. Его главная особенность заключается в системе QuarTeks, в которой прутки филамента подведены практически к самому соплу, б

5 часов назад
Базовая релиз MacBook Neo аномально быстро расходует источник SSD из‑за всего 8 ГБ оперативной памяти
Автор YouTube‑канала UFD Tech рассказал, что MacBook Neo необычно быстро расходует источник SSD‑накопителя. Всё дело в небольшом объёме оперативной памяти, из‑за которой устройство активно записывает

5 часов назад
Anthropic предупредила пользователей Claude об утечке их данных для входа из‑за вредоносного ПО
Организация Anthropic предупредила, что инфостилеры перехватывают сеансы Claude и открывают злоумышленникам доступ к учётным записям пользователей. Читать далее