Перейти к содержимому
Экосистема AI Vibe

Новости

Топ ASR на Hugging Face может «зубрить» бенчмарки вместо того, чтобы слышать речь

Редакция 21 августа 2026 г.

График сравнения word error rate и доли воспроизведения ошибочных эталонов у ASR-моделей на бенчмарке VoxPopuli.

Hume AI предложила три пробы, которые показывают подгонку open-source ASR под открытые бенчмарки: чем ниже word error rate на VoxPopuli и LibriSpeech, тем чаще модель копирует эталонную транскрипцию, даже когда аудио говорит другое. В выборке — 11 систем, от Whisper до Cohere Transcribe и Parakeet.

Открытые тесты сравнивают всех подряд, и модели подхватывают паттерны конкретного датасета — иногда по акустическим подсказкам, по которым узнают VoxPopuli или LibriSpeech. Held-out наборы в Real World VoiceEQ, Open-ASR Leaderboard и Far-field ASR Leaderboard расширяют картину, но без таких проб подгонку не видно.

Три пробы

  • Спор с эталоном — если reference ошибается, модель пишет по звуку или повторяет бенчмарк?
  • Вырезанные числа — число удалено из аудио; выдача «2011» из эталона при тишине на месте года — признак подгонки.
  • Орфография под датасет — модель переключает «anyone» и «any one» в зависимости от эталона конкретного датасета.

«Thank you» из эталона VoxPopuli

На клипе слышно «Thank you, Mr. President», а эталон VoxPopuli опускает «Thank you» — шесть из 11 моделей повторяют эту ошибку на оригинальной записи и копируют стиль пунктуации эталона («Mr» без точки). Методология нашла потенциальные ошибки reference в 40% тестовых клипов VoxPopuli, затрагивая примерно 3% всех слов эталона. У моделей с самым низким WER доля воспроизведения неверного эталона — 18–30%.

Свежий голос и замаскированные числа

На клонах того же спикера или свежих парламентских записях EU большинство моделей снова транскрибирует слышимое «Thank you». Parakeet — единственная, кто на оригинале копирует бенчмарк, а на клоне спикера поправляется; Phi-4 до сих пор опускает courtesy даже на записи после cutoff обучения. В generic TTS все одиннадцать возвращают фразу целиком.

На LibriSpeech с вырезанными числами сильнейшие по бенчмарку модели восстанавливали числа в 30–40% примеров, хотя звука не было — на свежесобранных записях эффект слабел. В пробе с бюджетом 2011 года модели подставляли год и «more than 1 amendments», хотя в аудио было «one thousand six hundred», а год был замолчен.

Источник: Measuring benchmark optimization in speech recognition.