54 минуты назад
NVIDIA выпустила открытую схема, которая определяет, кто и когда говорил

NVIDIA выпустила Nemotron 3 Diarization, компактную схема для определения того, кто и когда говорит в аудиозаписи. Она содержит около 100 млн параметров, работает с прямыми эфирами и готовыми записями, поддерживает до восьми собеседников и не теряется, когда несколько человек говорят одновременно.
Веса опубликованы на Hugging Face под лицензией OpenMDW 1.1. В соответствии с карточке модели, её разрешено применять как в коммерческих, так и в некоммерческих проектах.
Что именно умеет модель
Nemotron 3 решает задачу диаризации. Если обычная платформа распознавания речи отвечает на вопрос «что сказали», то диаризация определяет «кто говорил в этот момент».
На выходе модель создаёт временную шкалу с анонимными метками:
speaker_0: 00:00–00:07 speaker_1: 00:06–00:12 speaker_0: 00:13–00:18
Пересечение первых двух отрезков означает, что собеседники говорили одновременно. Nemotron 3 может отмечать такую речь сразу в нескольких каналах.
Одновременно модель не расшифровывает содержание разговора и не определяет людей по имени или голосу. Она знает только условных speaker_0, speaker_1 и так далее. Для полноценной стенограммы её нужно объединить с ASR-моделью, а для определения личности потребуется отдельная система верификации говорящего.
Nemotron 3 принимает одноканальное аудио с частотой 16 кГц и выдаёт таблицу вероятностей размером [T, 8]. Каждая из восьми колонок соответствует одному говорящему, а строки по умолчанию описывают отрезки продолжительностью 10 мс.
Один чекпойнт для записи и прямого эфира
Одна и та же модель может обрабатывать готовые файлы и потоковое аудио. В последнем случае она получает запись небольшими фрагментами и использует кеш ранее услышанных голосов, чтобы не менять метки собеседников после пауз и перебиваний.
Голоса нумеруются в порядке появления. Первый участник разговора становится speaker_0, следующий speaker_1.
Разработчик может выбирать между несколькими режимами задержки. NVIDIA рекомендует буферы продолжительностью 30,4, 1,04, 0,64 или 0,32 секунды. Технически модель может функционировать с буфером 80 мс, но минимальным рекомендуемым значением остаются 320 мс.
Эти цифры описывают только количество аудио, которое необходимо накопить перед запуском модели. Сетевая задержка, распознавание слов и остальная обработка в них не учитываются.
Что показали тесты
В предварительном рейтинге VoiceArena Diarization-Bench модель заняла первое место среди 12 систем и 17 конфигураций. Тест включал 139 англоязычных разговоров общей продолжительностью приблизительно 22 часов.
Nemotron 3 получила 14,72% DER против 19,3% у ближайшего конкурента. DER, или diarization error rate, складывается из пропущенной речи, ложных срабатываний и случаев, когда реплика приписана не тому участнику. Чем меньше показатель, тем лучше результат.
Разница составляет около 24% в по сравнению см выражении. Однако NVIDIA отдельно предупреждает, что результаты VoiceArena пока предварительные и могут измениться после завершения первой версии тестирования.
В собственных тестах компании Nemotron 3 при буфере 1,04 секунды снизила DER во всех восьми проверенных условиях по сравнению с предыдущей потоковой моделью NVIDIA. Среднее по сравнению се улучшение составило 41%. Предшественница поддерживала только четырёх говорящих, новая модель увеличила предел до восьми.
Прирост особенно заметен в разговорах с большим количеством участников. Правда, на одном из тестов с двумя собеседниками старая модель всё же показала немного меньшую ошибку. Универсальной победы на каждом отдельном сценарии не получилось.
Как запустить
Модель поддерживается фреймворками NVIDIA NeMo и Hugging Face Transformers. Для локального запуска равным образом доступен облегчённый C++-рантайм NeMo-Speech.cpp.
После его установки обработка записи запускается одной командой:
nemo-speech diarize meeting.wav
Можно сразу объединить диаризацию с распознаванием речи и получить итог в JSON:
nemo-speech transcribe meeting.wav --diarize --json
На Hugging Face опубликованы веса в форматах NeMo и Safetensors, примеры кода и интерактивная презентация.
Для чего это пригодится
Основные сценарии довольно приземлённые. Это стенограммы совещаний, звонки поддержки, интервью, подкасты, медицинские консультации и голосовые агенты, которым важно понимать не только содержание фразы, но и её автора.
Размер в 100 млн параметров делает Nemotron 3 значительно компактнее современных генеративных моделей. Её можно запускать локально и не отправлять записи разговоров во внешний служба. Впрочем, требования к скорости и оборудованию всё равно придётся проверять на собственном сценарии.
Попробуйте Kodacode на своём проекте: скачать для IDE, CLI и Desktop. Анонсы обновлений, практические разборы и новости продукта в нашем Telegram‑канале.

Читают сейчас
2 часа назад
OpenAI может представить always-on агента на DevDay
В коде и интерфейсе ChatGPT начали всплывать следы нового агента под коротким названием «o». И да, судя по всему, OpenAI снова решила, что одной буквы для продукта вполне в достаточной степени. Упомин

2 часа назад
Новые солнечные панели на основе олова дольше удерживают тепло и могут показать рекордную производительность
Исследователи из Университета Гронингена в Нидерландах обнаружили, что перовскитные солнечные элементы на основе олова могут замедлять потерю тепла высокоэнергетическими «горячими электронами». Это мо

2 часа назад
Julia 1: выпуск модели в духе Jev с открытыми весами и запуском на CPU
У Supersonic Labs вышла Julia 1 — небольшая схема для классификации текстов и выбора из заданных вариантов. В ней 144 млн параметров, веса занимают приблизительно 550 МБ, а для запуска достаточно CPU.

3 часа назад
В Outlook появится опция автоматической проверки орфографии перед отправкой писем
В Outlook появится функция автоматической проверки орфографии перед отправкой писем. Она заработает у части пользователей с октября 2026 года, а полноценный запускание ожидается в середине декабря. В

4 часа назад
Microsoft подготовила инициатива кодекса, который описывает правила поведения и механизмы контроля ИИ
Microsoft опубликовала проект «Кодекса поведения гуманистического ИИ» (Humanist AI Code of Conduct). Документ устанавливает правила поведения для искусственного интеллекта, а также обязательные и не п