WER — метрика ошибок распознавания речи. По ссылке доступны определения WER, micro-WER, медианы WER и среднего WER.
В первой статье мы сравнили пять движков распознавания русской речи. В третьем замере заменили смешанную выборку 250 фрагментами спонтанной речи продолжительностью 10–45 секунд, и порядок движков изменился. Затем сравнили русскоязычные речевые корпуса по типу речи, разметке, лицензии и цене.
Как менялся порядок движков
В RetailCRM мы транскрибируем около 100 тысяч звонков в месяц. Skillum.AI также работает со встречами, переговорами и речью в торговых залах. Стенд и движки между замерами не менялись; менялись только входные данные.
| Замер | Выборка | Стоимость |
|---|---|---|
| №1 | 20 записей: 8 команд Golos farfield (около 3 с) + 5 обращений SOVA (около 4 с) + 7 спонтанных фрагментов Common Voice (около 16 с) | 0,49 $ |
| №2 | 60 записей: только спонтанная речь, 10–30 с | около 2,3 $ |
| №3 | 250 записей: спонтанная речь 10–45 с, около 100 минут аудио | 4,12 $ (верхняя граница) |
| №4 | 491 запись: весь корпус, 2,4–94,6 с, около 3 часов аудио | около 8 $ |
Смешанная выборка №1 состояла из 13 коротких команд и обращений и 7 спонтанных фрагментов. Минимальная медиана WER на ней была у Nexara — 0,111. В выборке №3 из 250 фрагментов спонтанной речи продолжительностью 10–45 секунд минимальную медиану показал Deepgram — 0,083. Значения micro-WER OpenAI, Deepgram и локального faster-whisper были близки: 0,099, 0,100 и 0,101. Порядок движков на двух выборках различался.
Результаты замера №1 не подходят для выбора движка под спонтанную речь продолжительностью до 45 секунд.
Зацикливание Nexara. В замере №3 сбой возник на части записей продолжительностью 30–45 секунд: WER составил 0,39–0,40 против 0,07–0,11 на более коротких фрагментах, а гипотеза оказалась в 1,3–4,9 раза длиннее эталона. Разбивка по длительности помогла обнаружить проблему. В контрольных запусках она не повторилась ни после нарезки тех же клипов пополам со склейкой гипотез (micro-WER 0,112 против 0,369 и 0,318 у целых), ни на склеенном файле длительностью 25,8 минуты (WER 0,088). Связь с формой запроса или сегментацией остаётся гипотезой. В рабочей системе длинные записи следует сегментировать и отдельно проверять на собственном аудио.
На результат влияет вся система. Даже у решений из одного семейства качество зависит от сегментации, параметров инференса, таймаутов и входных данных. Точная модель Nexara публично не раскрыта, поэтому мы не приравниваем её к OpenAI whisper-1 или локальному faster-whisper и сравниваем готовые решения в одном стенде.
Качество зависит от типа речи
| Тип речи | Примеры корпусов | В чём особенность |
|---|---|---|
| Команды устройствам | Golos farfield, SOVA RuDevices | 3–4 секунды, узкий словарь, дальний микрофон колонки |
| Читка | аудиокниги, RUSLAN, DataOcean | подготовленный текст, чистая дикция — заметно легче живой речи |
| Спонтанные монологи | Common Voice Spontaneous Speech | оговорки, перестройки фразы на ходу, паузы |
| Телефонные диалоги | OpenSTT (звонки), CALLFRIEND | 8 кГц, два голоса, перебивания |
| Встречи, многоголосые | AMI, ICSI, NOTSOFAR-1 — только английские | дальний микрофон, наложения нескольких голосов |
| Синтетика | TTS-генерация | эталон точен по построению, но акустика легче реальной |
Порядок движков может меняться вместе с типом речи и акустическими условиями. При оценке бенчмарка проверьте, совпадают ли они с условиями вашего продукта.
Три ловушки речевых данных
Ловушка 1. Ошибки в эталонах меняют результат
Архивный репозиторий OpenSTT содержит 20 108 часов русской речи. Два телефонных обучающих поднабора дают 812 часов; для них указаны ASR-разметка и авторская оценка 70% / noisy. Остальные части размечены иначе: выравниванием, субтитрами, синтезом или вручную. В наборе есть и валидационная часть asr_calls_2_val с ручной разметкой. По данным T-Bank, WER модели T-one на исходной версии эталонов этого набора составил 20,27%, а после повторной разметки тех же записей — 7,94%.
Разница показывает, насколько ошибки в эталонах могут искажать оценку. Если их вклад сопоставим с различиями между движками, надёжно определить лидера нельзя.
В версии 3 работы Balalaika описано 5 078 часов русской речи из нескольких источников. Итоговые транскрипты получают ROVER-голосованием пяти гипотез: трёх вариантов GigaAM, Vosk и T-one. Без ручного аудита такой корпус не является независимым эталоном для сравнения ASR: метрика может зависеть от сходства тестируемой системы с моделями-разметчиками. Корпус создавался для синтеза речи.
Ловушка 2. Лицензии: NC, ND и «не идентифицировать говорящих»
- CC BY-NC (OpenSTT) разрешает некоммерческое использование; коммерческое возможно после соглашения с авторами. Применимость к внутренней оценке коммерческого продукта нужно согласовать отдельно.
- CC BY-NC-ND 4.0 (Balalaika) запрещает коммерческое использование и производные. Оригинальное аудио сохраняет лицензии исходных источников.
- LDC User Agreement применяется к CALLFRIEND Russian Speech. Транскрипты и лексикон лицензируются отдельно как LDC2023T09, а размер платы виден после входа в каталог.
- Собственная лицензия применяется к MagicHub ASR-RusCSC. Публичная карточка предлагает запросить условия у поставщика и не заявляет бесплатного тарифа для этого корпуса.
- Лицензия и условия доступа могут отличаться. Карточка Common Voice указывает CC0 1.0, а условия Mozilla отдельно запрещают устанавливать личности говорящих и повторно размещать или распространять набор.
Ловушка 3. Число часов скрывает состав корпуса
Стенд использует зафиксированный срез Mozilla Common Voice Spontaneous Speech 3.0 ru: 491 запись с эталонами, около 3,1 часа, медиана 18,4 секунды, максимум 94,6 секунды и всего 15 говорящих. Одинаковая выборка обеспечивает единые входные данные для движков, однако не гарантирует, что порядок сохранится на другом наборе голосов. На 29 июля 2026 года Mozilla уже опубликовала версию 4.0: 552 клипа, 3,4 часа и 17 говорящих.
Некоторые карточки на Hugging Face содержат лишь небольшое публичное превью коммерческого корпуса. Параметры описаний UniData и Nexdata совпадают — 338 часов и 460 говорящих, — однако происхождение и связь наборов мы не подтвердили. Карточка MaratDV описывает около 832 часов звонков, но публично не указывает наличие и формат эталонных транскриптов. Пригодность этого предложения для оценки ASR без ответа поставщика установить нельзя.
Карта рынка русских разговорных данных (июль 2026)
Данные актуальны на июль 2026 года. Объём, тип разметки, лицензии и цены указаны по страницам авторов и поставщиков.
| Корпус | Объём | Тип речи | Эталоны | Лицензия / цена | Ограничения для оценки ASR |
|---|---|---|---|---|---|
| CV Spontaneous Speech 3.0 ru | 491 запись, около 3,1 ч, 15 голосов | спонтанные монологи | ручные | CC0 1.0; отдельные условия доступа | срез нашего стенда; мало говорящих; повторное размещение набора запрещено условиями Mozilla |
| OpenSTT | 20 108 ч; телефония — 812 ч | звонки, читка, публичная речь и др. | разные способы; телефонная обучающая часть — ASR-разметка, валидационная — ручная | CC BY-NC; коммерческое использование по соглашению | репозиторий архивирован; эталоны тестовой части нужно перепроверить |
| Balalaika | 5 078 ч | несколько типов русской речи | автоматические, ROVER по пяти ASR-гипотезам | CC BY-NC-ND 4.0; исходное аудио — по лицензиям источников | без ручного аудита не служит независимым эталоном ASR |
| ОРД, СПбГУ | 1250 ч, 128 информантов | живая бытовая и рабочая речь (диктофон 24 ч на человеке) | ручные лингвистические, ~10% объёма | академический доступ | концептуально ближе всего к «русскому AMI»; формат неудобен для ASR |
| CALLFRIEND Russian Speech | 100 звонков, около 48 ч, 8 кГц | телефонные диалоги 1999 года; носители русского в США | транскрипты лицензируются отдельно как LDC2023T09 | LDC User Agreement; плата видна после входа | устаревший домен и отдельная лицензия на текст |
| MagicHub ASR-RusCSC | карточка расходится: 1 294 ч в сводке и 985 ч / 591 говорящий в описании | описан одновременно как сценарный и спонтанный | заявлены | собственная лицензия; условия по запросу | перед оценкой нужна спецификация поставщика |
| Nexdata | 336–338 ч, 460 говорящих; значения на странице расходятся | спонтанные диалоги | заявлены; есть образцы | коммерческое предложение по запросу | сначала проверить образец и уточнить объём |
| Defined.ai Russian Spontaneous Dialogue | 1 095 ч в четырёх текущих карточках | моделируемые диалоги колл-центра: страхование, связь, банки, розница | заявлены | коммерческое предложение по запросу | не реальные звонки; объём старой и текущей витрины различается |
| FutureBee Russian General Conversation | 30–50 ч и 60–70 участников; разделы страницы расходятся | двухголосые диалоги, стерео с раздельными каналами | поставщик заявляет ручную дословную разметку, двойной контроль и WER < 5% | коммерческая лицензия по запросу | характеристики заявлены продавцом; образец нужно запросить |
| UniData / AxonData | небольшие публичные превью разных коммерческих предложений | UniData — диалоги; AxonData — записи колл-центра | в превью | условия по запросу | по публичным файлам нельзя оценить полный корпус |
| MaratDV | около 832 ч звонков | телефония | наличие и формат публично не указаны | коммерческая лицензия; запрет перераспространения | пригодность для оценки нужно подтвердить у поставщика |
| Аналог AMI среди проверенных каталогов | не найден | совещания с несколькими участниками | нужны пословные транскрипты и разметка говорящих | открытые и коммерческие источники | результат поиска на 29 июля 2026 года, а не утверждение обо всём рынке |
Среди свежих релизов, которые мы проверили, GigaAM v3 и T-one публикуются как модели и код, без обучающих корпусов. Это не означает, что компании никогда не открывали данные: например, Сбер публикует корпус Golos объёмом 1 240 часов. В текущей витрине Toloka мы не нашли готового русскоязычного речевого корпуса, но платформа продолжает предлагать сбор аудио и разметку речи на заказ.
Сопоставимого русскоязычного корпуса встреч мы не нашли
AMI Meeting Corpus содержит 100 часов англоязычных встреч, записи с близких и дальних микрофонов и ручные транскрипты с пословными временными метками. Около трети встреч естественные, остальные проходят по ролевым сценариям. Корпус доступен по CC BY. ICSI добавляет около 70 часов встреч с ручными аннотациями, а NOTSOFAR-1 — 315 коротких встреч из 30 конференц-залов.
Среди проверенных открытых и коммерческих каталогов на 29 июля 2026 года мы не нашли русскоязычного корпуса, который одновременно содержит записи совещаний, ручные пословные транскрипты и разметку говорящих. Ближе всего по характеру речи ОРД СПбГУ («Один речевой день»), но ручные расшифровки покрывают около 10% объёма.
В 2026 году авторы описали RusAudioForum: около 20 часов публичных мероприятий, 18 записей и от 3 до 11 говорящих. В работе указаны вручную проверенные временные метки диаризации, но не пословные эталоны ASR, поэтому это полезный многоголосый набор, а не полный аналог AMI. Для наших сценариев встреч и переговорных всё равно потребуется собственная размеченная выборка.
Как мы выбираем данные
К правилам из первой статьи мы добавили следующие:
- манифесты с SHA-256 — любой может скачать ту же выборку и повторить замер;
- детерминированный отбор с фиксированным зерном случайности;
- нормализация всех записей к WAV 16 бит / 24 кГц / моно;
- отдельный публичный пакет — без ключей, локальных путей и идентификаторов говорящих; право на публикацию аудио, текстов и производных проверяется отдельно;
- предрасчёт стоимости до любого платного запуска;
- независимая проверка конфигурации, стоимости и итоговых метрик перед публикацией.

Замеры увеличивались поэтапно. №1 — смешанная выборка команд и спонтанной речи за 0,49 $ для проверки стенда. №2 — 60 фрагментов спонтанной речи примерно за 2,3 $. №3 — 250 записей продолжительностью до 45 секунд за 4,12 $, на которых обнаружилось зацикливание Nexara. №4 — весь корпус из 491 записи примерно за 8 $. После пересчёта методикой v2 на общем пересечении из 488 записей среди пяти участников этого этапа лучший micro-WER показал faster-whisper large-v3 — 9,78%. После добавления остальных режимов итоговый рейтинг возглавила GigaAM с 7,46%.
Эти замеры последовательно увеличивали размер выборки и длительность записей, но оставались на командах и спонтанных монологах. Для звонков, торговых залов и переговорных нужны отдельные корпуса.
Как выбрать корпус для оценки ASR
- Домен совпадает с продуктом? Команды, читка, звонки и встречи — разные задачи; лидер меняется от строки к строке.
- Кто делал эталоны и как? Для независимой оценки нужны ручные или перепроверенные эталоны; автоматическую разметку нельзя принимать за независимый тестовый эталон.
- Оцените ошибки эталонов. Их вклад должен быть заметно ниже различий, которые вы хотите увидеть.
- Дочитайте условия использования до конца: NC, ND, исследовательские соглашения и дополнительные ограничения площадки.
- Считайте говорящих, а не только часы. В нашем срезе 3,1 часа распределены между 15 людьми.
- Есть ли записи типичной длительности? В нашем замере зацикливание появилось на части записей длиннее 30 секунд, поэтому выборка должна покрывать длительности из продукта.
- Акустика соответствует продукту? Телефония 8 кГц, переговорная и торговый зал звучат по-разному: частота дискретизации, каналы, микрофон.
- Дата выпуска. Она помогает оценить риск пересечения с обучающими данными, если известны даты их сбора или отсечения.
- Воспроизводимость: манифест с контрольными суммами и фиксированное зерно отбора — иначе замер нельзя повторить и нельзя проверить.
- Для платных наборов — сначала образец. Перед покупкой проверьте разметку: краткой карточки без доступных данных для оценки недостаточно.
Что дальше
- Валидационные наборы OpenSTT с собственной ревизией эталонов — урок T-one применяем к себе: сначала перепроверить разметку, потом мерить.
- Запросить образцы FutureBee и Nexdata — оценить качество разметки до обсуждения цен.
- ОРД — запросить академический доступ: единственный корпус живой русской речи такого масштаба.
- Собственный размеченный небольшой корпус под встречи и торговый зал — среди проверенных источников подходящего готового набора мы не нашли.
Первая часть: «В нашем тесте лучший движок распознавания русской речи оказался открытым и локальным». Источники: AMI Meeting Corpus · OpenSTT · T-one · Balalaika · ОРД · Common Voice Spontaneous · LDC CALLFRIEND · Nexdata · Defined.ai · FutureBee · MagicHub.