Nemotron 3 Diarization: открытая модель NVIDIA на 8 спикеров

NVIDIA выложила open-weight Nemotron 3 Diarization — модель на 100 млн параметров, которая размечает, кто и когда говорил в записи или в эфире. На VoiceArena Diarization-Bench она лидирует с ошибкой диаризации 14,72% при перекрывающейся речи; следующая система в том же зачёте — 19,3%. Поддерживается до восьми анонимных каналов спикеров, режимы офлайна и стриминга.
Не путать с распознаванием речи
Диаризация отвечает за интервалы активности голосов, ASR — за слова. Транскрипт «кто что сказал» склеивают из двух выходов: таймкоды накладывают на текст. Пропуски речи, ложные срабатывания и перепутанные спикеры считают отдельно от ошибок ASR — иначе цифры с бенчмарка не переносятся в ваш пайплайн с микрофоном, саммари или памятью голосового агента.
Стриминг и задержка
В стриме модель наследует подход Sortformer: каналы упорядочены по моменту первого появления голоса, чтобы метки не «перепрыгивали» между чанками. Контекст держат кэш спикеров по порядку появления и очередь недавних кадров; правый контекст после чанка балансирует точность и отклик. Рекомендуемые буферы входа — 30,4; 1,04; 0,64 и 0,32 секунды; для прод-настроек нижняя граница 0,32 с, хотя технически возможны и 80 мс.
Бенчмарки
- VoiceArena Diarization-Bench v1: 12 систем, 139 английских разговоров (~22 часа), Nemotron 3 на первом месте.
- Сравнение с четырёхспикерным чекпоинтом
diar_streaming_sortformer_4spk-v2.1: при буфере 1,04 с среднее относительное снижение DER по восьми датасетам — 41%. - Оценка через NeMo
e2e_diarize_speech.py; в обучении — многоязычные смеси на 21 язык.
На двухспикерном подмножестве CALLHOME финальная модель чуть хуже прежнего baseline (5,98% против 5,68% DER); на сценариях с пятью и более участниками выигрыш заметнее.
Источник: Know Who Spoke When: Build Real-Time, Multi-Speaker AI with NVIDIA Nemotron 3 Diarization.