Предыстория
Полгода назад мы опубликовали сравнительное исследование GigaAM и Whisper для распознавания русской речи и получили WER 3,3% на GigaAM. Замеры проводились на пяти TTS-фрагментах из аудиокниг — синтетически чистых записях без фонового шума и реверберации. Результаты тогда подтверждали тезис «специализация бьёт универсальность»: GigaAM, созданный специально под русский язык, уверенно опережал универсальный Whisper.
Проблема выяснилась позже, когда мы перешли к реальным продакшен-записям. Оказалось, что синтетические TTS-данные плохо отражают условия, с которыми система сталкивается в бою. Это и стало отправной точкой для переизмерения — и для трёх неприятных открытий.
Три ловушки бенчмарка
Первый замер на реальных данных показал: GigaAM опережает Whisper на 7 процентных пунктов по WER (Word Error Rate — доля неверно распознанных слов). Казалось бы, тезис подтверждён. Но после небольшой чистки тех же самых данных картина изменилась кардинально: обе модели вышли на одинаковый уровень точности.
Дальнейший анализ обнаружил третью ловушку: на самом шумном фрагменте подкаста с реверберацией (эхо в помещении) Whisper обогнал GigaAM уже на 19 п.п. — разрыв не в пользу «специализации», а против неё. Всё это — один и тот же подкаст, одни и те же скрипты, одни и те же версии моделей. Разница исключительно в том, как именно был организован замер.
Обработка аудио: когда «улучшение» вредит
Параллельно мы протестировали 10 методов предобработки аудиосигнала перед подачей в модель. Интуитивно кажется, что шумоподавление, нормализация и фильтрация должны помогать — в итоге большинство из них ухудшили результаты распознавания.
Это неочевидный, но важный вывод для практиков: автоматическая предобработка не является нейтральной операцией. Она может смещать спектральные характеристики сигнала так, что модель начинает работать хуже, чем на «сыром» аудио. Какие именно методы оказались вредоносными и почему — разбираем под катом.
RTF (Real-Time Factor) — метрика, показывающая, сколько секунд вычислительного времени тратится на распознавание одной секунды аудио. Чем ниже RTF, тем быстрее работает система. Замеры RTF проводились на RTX 4090 как на референсном GPU-окружении.
Итоговый выбор
По итогам переизмерения мы сформулировали финальную рекомендацию с разбивкой по типу железа. Для GPU-окружения — дообученный Whisper-turbo: модель устойчивее держится на шумных записях с реверберацией, а замеры RTF на RTX 4090 подтвердили приемлемую скорость для продакшена.
Для CPU-окружения — GigaAM v3-e2e-rnnt: при отсутствии GPU эта архитектура (e2e-rnnt — end-to-end рекуррентная нейронная сеть с транзитивным декодированием) даёт лучший баланс точности и скорости инференса на процессоре. Почему именно такое разделение — и что именно тестировалось под капотом — в полном тексте.