NVIDIA выпустила открытую схема, которая определяет, кто и когда говорил

4 мин
NVIDIA выпустила открытую схема, которая определяет, кто и когда говорил

NVIDIA выпустила Nemotron 3 Diarization, компактную схема для определения того, кто и когда говорит в аудиозаписи. Она содержит около 100 млн параметров, работает с прямыми эфирами и готовыми записями, поддерживает до восьми собеседников и не теряется, когда несколько человек говорят одновременно.

Веса опубликованы на Hugging Face под лицензией OpenMDW 1.1. В соответствии с карточке модели, её разрешено применять как в коммерческих, так и в некоммерческих проектах.

Что именно умеет модель

Nemotron 3 решает задачу диаризации. Если обычная платформа распознавания речи отвечает на вопрос «что сказали», то диаризация определяет «кто говорил в этот момент».

На выходе модель создаёт временную шкалу с анонимными метками:

speaker_0: 00:00–00:07
speaker_1: 00:06–00:12
speaker_0: 00:13–00:18

Пересечение первых двух отрезков означает, что собеседники говорили одновременно. Nemotron 3 может отмечать такую речь сразу в нескольких каналах.

Одновременно модель не расшифровывает содержание разговора и не определяет людей по имени или голосу. Она знает только условных speaker_0, speaker_1 и так далее. Для полноценной стенограммы её нужно объединить с ASR-моделью, а для определения личности потребуется отдельная система верификации говорящего.

Nemotron 3 принимает одноканальное аудио с частотой 16 кГц и выдаёт таблицу вероятностей размером [T, 8]. Каждая из восьми колонок соответствует одному говорящему, а строки по умолчанию описывают отрезки продолжительностью 10 мс.

Один чекпойнт для записи и прямого эфира

Одна и та же модель может обрабатывать готовые файлы и потоковое аудио. В последнем случае она получает запись небольшими фрагментами и использует кеш ранее услышанных голосов, чтобы не менять метки собеседников после пауз и перебиваний.

Голоса нумеруются в порядке появления. Первый участник разговора становится speaker_0, следующий speaker_1.

Разработчик может выбирать между несколькими режимами задержки. NVIDIA рекомендует буферы продолжительностью 30,4, 1,04, 0,64 или 0,32 секунды. Технически модель может функционировать с буфером 80 мс, но минимальным рекомендуемым значением остаются 320 мс.

Эти цифры описывают только количество аудио, которое необходимо накопить перед запуском модели. Сетевая задержка, распознавание слов и остальная обработка в них не учитываются.

Что показали тесты

В предварительном рейтинге VoiceArena Diarization-Bench модель заняла первое место среди 12 систем и 17 конфигураций. Тест включал 139 англоязычных разговоров общей продолжительностью приблизительно 22 часов.

Nemotron 3 получила 14,72% DER против 19,3% у ближайшего конкурента. DER, или diarization error rate, складывается из пропущенной речи, ложных срабатываний и случаев, когда реплика приписана не тому участнику. Чем меньше показатель, тем лучше результат.

Разница составляет около 24% в по сравнению см выражении. Однако NVIDIA отдельно предупреждает, что результаты VoiceArena пока предварительные и могут измениться после завершения первой версии тестирования.

В собственных тестах компании Nemotron 3 при буфере 1,04 секунды снизила DER во всех восьми проверенных условиях по сравнению с предыдущей потоковой моделью NVIDIA. Среднее по сравнению се улучшение составило 41%. Предшественница поддерживала только четырёх говорящих, новая модель увеличила предел до восьми.

Прирост особенно заметен в разговорах с большим количеством участников. Правда, на одном из тестов с двумя собеседниками старая модель всё же показала немного меньшую ошибку. Универсальной победы на каждом отдельном сценарии не получилось.

Как запустить

Модель поддерживается фреймворками NVIDIA NeMo и Hugging Face Transformers. Для локального запуска равным образом доступен облегчённый C++-рантайм NeMo-Speech.cpp.

После его установки обработка записи запускается одной командой:

nemo-speech diarize meeting.wav

Можно сразу объединить диаризацию с распознаванием речи и получить итог в JSON:

nemo-speech transcribe meeting.wav --diarize --json

На Hugging Face опубликованы веса в форматах NeMo и Safetensors, примеры кода и интерактивная презентация.

Для чего это пригодится

Основные сценарии довольно приземлённые. Это стенограммы совещаний, звонки поддержки, интервью, подкасты, медицинские консультации и голосовые агенты, которым важно понимать не только содержание фразы, но и её автора.

Размер в 100 млн параметров делает Nemotron 3 значительно компактнее современных генеративных моделей. Её можно запускать локально и не отправлять записи разговоров во внешний служба. Впрочем, требования к скорости и оборудованию всё равно придётся проверять на собственном сценарии.

Попробуйте Kodacode на своём проекте: скачать для IDE, CLI и Desktop. Анонсы обновлений, практические разборы и новости продукта в нашем Telegram‑канале.

Читают сейчас

2 часа назад

OpenAI может представить always-on агента на DevDay

В коде и интерфейсе ChatGPT начали всплывать следы нового агента под коротким названием «o». И да, судя по всему, OpenAI снова решила, что одной буквы для продукта вполне в достаточной степени. Упомин

Новые солнечные панели на основе олова дольше удерживают тепло и могут показать рекордную производительность

2 часа назад

Новые солнечные панели на основе олова дольше удерживают тепло и могут показать рекордную производительность

Исследователи из Университета Гронингена в Нидерландах обнаружили, что перовскитные солнечные элементы на основе олова могут замедлять потерю тепла высокоэнергетическими «горячими электронами». Это мо

Julia 1: выпуск модели в духе Jev с открытыми весами и запуском на CPU

2 часа назад

Julia 1: выпуск модели в духе Jev с открытыми весами и запуском на CPU

У Supersonic Labs вышла Julia 1 — небольшая схема для классификации текстов и выбора из заданных вариантов. В ней 144 млн параметров, веса занимают приблизительно 550 МБ, а для запуска достаточно CPU.

В Outlook появится опция автоматической проверки орфографии перед отправкой писем

3 часа назад

В Outlook появится опция автоматической проверки орфографии перед отправкой писем

В Outlook появится функция автоматической проверки орфографии перед отправкой писем. Она заработает у части пользователей с октября 2026 года, а полноценный запускание ожидается в середине декабря. В 

Microsoft подготовила инициатива кодекса, который описывает правила поведения и механизмы контроля ИИ

4 часа назад

Microsoft подготовила инициатива кодекса, который описывает правила поведения и механизмы контроля ИИ

Microsoft опубликовала проект «Кодекса поведения гуманистического ИИ» (Humanist AI Code of Conduct). Документ устанавливает правила поведения для искусственного интеллекта, а также обязательные и не п