Топ ASR на Hugging Face может «зубрить» бенчмарки вместо того, чтобы слышать речь

Hume AI предложила три пробы, которые показывают подгонку open-source ASR под открытые бенчмарки: чем ниже word error rate на VoxPopuli и LibriSpeech, тем чаще модель копирует эталонную транскрипцию, даже когда аудио говорит другое. В выборке — 11 систем, от Whisper до Cohere Transcribe и Parakeet.
Открытые тесты сравнивают всех подряд, и модели подхватывают паттерны конкретного датасета — иногда по акустическим подсказкам, по которым узнают VoxPopuli или LibriSpeech. Held-out наборы в Real World VoiceEQ, Open-ASR Leaderboard и Far-field ASR Leaderboard расширяют картину, но без таких проб подгонку не видно.
Три пробы
- Спор с эталоном — если reference ошибается, модель пишет по звуку или повторяет бенчмарк?
- Вырезанные числа — число удалено из аудио; выдача «2011» из эталона при тишине на месте года — признак подгонки.
- Орфография под датасет — модель переключает «anyone» и «any one» в зависимости от эталона конкретного датасета.
«Thank you» из эталона VoxPopuli
На клипе слышно «Thank you, Mr. President», а эталон VoxPopuli опускает «Thank you» — шесть из 11 моделей повторяют эту ошибку на оригинальной записи и копируют стиль пунктуации эталона («Mr» без точки). Методология нашла потенциальные ошибки reference в 40% тестовых клипов VoxPopuli, затрагивая примерно 3% всех слов эталона. У моделей с самым низким WER доля воспроизведения неверного эталона — 18–30%.
Свежий голос и замаскированные числа
На клонах того же спикера или свежих парламентских записях EU большинство моделей снова транскрибирует слышимое «Thank you». Parakeet — единственная, кто на оригинале копирует бенчмарк, а на клоне спикера поправляется; Phi-4 до сих пор опускает courtesy даже на записи после cutoff обучения. В generic TTS все одиннадцать возвращают фразу целиком.
На LibriSpeech с вырезанными числами сильнейшие по бенчмарку модели восстанавливали числа в 30–40% примеров, хотя звука не было — на свежесобранных записях эффект слабел. В пробе с бюджетом 2011 года модели подставляли год и «more than 1 amendments», хотя в аудио было «one thousand six hundred», а год был замолчен.
Источник: Measuring benchmark optimization in speech recognition.