Magpie TTS: 12 языков и 32 мс до первого звука в своём контуре

В каскадном голосовом агенте синтез речи — последний этап, и именно он решает, «тормозит» ли ответ для пользователя. NVIDIA выпустила Magpie Multilingual TTS с открытыми весами: развёртывание на своём железе, без круговых задержек managed-сервиса в метриках.
Модель на 364 млн параметров покрывает 12 языков — от английского и мандаринского до новых в релизе арабского, корейского и бразильского португальского. Мужские и женские голоса идут через общее представление спикера, отдельная TTS-модель на каждый регион не нужна. Для хинди и японского расширили переключение языков: IPA-преобразование графем в фонемы и словари произношения помогают с именами и техтерминами.
Задержка, которую слышит пользователь
Главная метрика — TTFA, время до первого звука. На B200 в NVIDIA NIM — 32 мс на одном потоке, на H100 — 47 мс, на A100 — 79 мс. При 64 параллельных потоках B200 выходит на 239 мс TTFA и пропускную способность 320× реального времени. Чекпоинт на Hugging Face — для исследований и дообучения; NIM — оптимизированный serving-стек с продакшн-цифрами.
Как ускорили без потери качества
Два приёма в архитектуре: frame stacking — декодер предсказывает два аудиокадра за шаг вместо одного; local transformer — восстанавливает качество между одновременно генерируемыми токенами. На французском CER снизился с 2.70% до 1.54%, на испанском — с 1.14% до 0.60%.
Полный стек голосового агента
Magpie входит в Nemotron Voice Agent Developer Example — референс, где связаны Nemotron Speech для потокового ASR, Magpie TTS, языковые модели Nemotron с вызовом инструментов и NVIDIA NIM. В примере есть прерывание разговора (barge-in), мультимодальные агенты с vision и мультиагентная оркестрация. Дообучение — через NeMo Speech; стартовые параметры инференса: cfg_scale = 2.5, temperature = 0.6, top_k = 80.
Источник: Build Low-Latency Multilingual Voice Agents: Open Weights & Full Deployment Control with NVIDIA Magpie TTS.