Исследование · часть 2

Как выбор речевого корпуса меняет результаты оценки ASR: обзор русских датасетов

Дмитрий Бороздин · 6 июля 2026

WER — метрика ошибок распознавания речи. По ссылке доступны определения WER, micro-WER, медианы WER и среднего WER.

В первой статье мы сравнили пять движков распознавания русской речи. В третьем замере заменили смешанную выборку 250 фрагментами спонтанной речи продолжительностью 10–45 секунд, и порядок движков изменился. Затем сравнили русскоязычные речевые корпуса по типу речи, разметке, лицензии и цене.

Как менялся порядок движков

В RetailCRM мы транскрибируем около 100 тысяч звонков в месяц. Skillum.AI также работает со встречами, переговорами и речью в торговых залах. Стенд и движки между замерами не менялись; менялись только входные данные.

ЗамерВыборкаСтоимость
№120 записей: 8 команд Golos farfield (около 3 с) + 5 обращений SOVA (около 4 с) + 7 спонтанных фрагментов Common Voice (около 16 с)0,49 $
№260 записей: только спонтанная речь, 10–30 соколо 2,3 $
№3250 записей: спонтанная речь 10–45 с, около 100 минут аудио4,12 $ (верхняя граница)
№4491 запись: весь корпус, 2,4–94,6 с, около 3 часов аудиооколо 8 $
Четыре замера — один стенд, разные данные

Смешанная выборка №1 состояла из 13 коротких команд и обращений и 7 спонтанных фрагментов. Минимальная медиана WER на ней была у Nexara — 0,111. В выборке №3 из 250 фрагментов спонтанной речи продолжительностью 10–45 секунд минимальную медиану показал Deepgram — 0,083. Значения micro-WER OpenAI, Deepgram и локального faster-whisper были близки: 0,099, 0,100 и 0,101. Порядок движков на двух выборках различался.

Результаты замера №1 не подходят для выбора движка под спонтанную речь продолжительностью до 45 секунд.

Зацикливание Nexara. В замере №3 сбой возник на части записей продолжительностью 30–45 секунд: WER составил 0,39–0,40 против 0,07–0,11 на более коротких фрагментах, а гипотеза оказалась в 1,3–4,9 раза длиннее эталона. Разбивка по длительности помогла обнаружить проблему. В контрольных запусках она не повторилась ни после нарезки тех же клипов пополам со склейкой гипотез (micro-WER 0,112 против 0,369 и 0,318 у целых), ни на склеенном файле длительностью 25,8 минуты (WER 0,088). Связь с формой запроса или сегментацией остаётся гипотезой. В рабочей системе длинные записи следует сегментировать и отдельно проверять на собственном аудио.

На результат влияет вся система. Даже у решений из одного семейства качество зависит от сегментации, параметров инференса, таймаутов и входных данных. Точная модель Nexara публично не раскрыта, поэтому мы не приравниваем её к OpenAI whisper-1 или локальному faster-whisper и сравниваем готовые решения в одном стенде.

Качество зависит от типа речи

Тип речиПримеры корпусовВ чём особенность
Команды устройствамGolos farfield, SOVA RuDevices3–4 секунды, узкий словарь, дальний микрофон колонки
Читкааудиокниги, RUSLAN, DataOceanподготовленный текст, чистая дикция — заметно легче живой речи
Спонтанные монологиCommon Voice Spontaneous Speechоговорки, перестройки фразы на ходу, паузы
Телефонные диалогиOpenSTT (звонки), CALLFRIEND8 кГц, два голоса, перебивания
Встречи, многоголосыеAMI, ICSI, NOTSOFAR-1 — только английскиедальний микрофон, наложения нескольких голосов
СинтетикаTTS-генерацияэталон точен по построению, но акустика легче реальной
Типы речевых данных и их особенности

Порядок движков может меняться вместе с типом речи и акустическими условиями. При оценке бенчмарка проверьте, совпадают ли они с условиями вашего продукта.

Три ловушки речевых данных

Ловушка 1. Ошибки в эталонах меняют результат

Архивный репозиторий OpenSTT содержит 20 108 часов русской речи. Два телефонных обучающих поднабора дают 812 часов; для них указаны ASR-разметка и авторская оценка 70% / noisy. Остальные части размечены иначе: выравниванием, субтитрами, синтезом или вручную. В наборе есть и валидационная часть asr_calls_2_val с ручной разметкой. По данным T-Bank, WER модели T-one на исходной версии эталонов этого набора составил 20,27%, а после повторной разметки тех же записей — 7,94%.

Разница показывает, насколько ошибки в эталонах могут искажать оценку. Если их вклад сопоставим с различиями между движками, надёжно определить лидера нельзя.

В версии 3 работы Balalaika описано 5 078 часов русской речи из нескольких источников. Итоговые транскрипты получают ROVER-голосованием пяти гипотез: трёх вариантов GigaAM, Vosk и T-one. Без ручного аудита такой корпус не является независимым эталоном для сравнения ASR: метрика может зависеть от сходства тестируемой системы с моделями-разметчиками. Корпус создавался для синтеза речи.

Ловушка 2. Лицензии: NC, ND и «не идентифицировать говорящих»

Ловушка 3. Число часов скрывает состав корпуса

Стенд использует зафиксированный срез Mozilla Common Voice Spontaneous Speech 3.0 ru: 491 запись с эталонами, около 3,1 часа, медиана 18,4 секунды, максимум 94,6 секунды и всего 15 говорящих. Одинаковая выборка обеспечивает единые входные данные для движков, однако не гарантирует, что порядок сохранится на другом наборе голосов. На 29 июля 2026 года Mozilla уже опубликовала версию 4.0: 552 клипа, 3,4 часа и 17 говорящих.

Некоторые карточки на Hugging Face содержат лишь небольшое публичное превью коммерческого корпуса. Параметры описаний UniData и Nexdata совпадают — 338 часов и 460 говорящих, — однако происхождение и связь наборов мы не подтвердили. Карточка MaratDV описывает около 832 часов звонков, но публично не указывает наличие и формат эталонных транскриптов. Пригодность этого предложения для оценки ASR без ответа поставщика установить нельзя.

Карта рынка русских разговорных данных (июль 2026)

Данные актуальны на июль 2026 года. Объём, тип разметки, лицензии и цены указаны по страницам авторов и поставщиков.

КорпусОбъёмТип речиЭталоныЛицензия / ценаОграничения для оценки ASR
CV Spontaneous Speech 3.0 ru491 запись, около 3,1 ч, 15 голосовспонтанные монологиручныеCC0 1.0; отдельные условия доступасрез нашего стенда; мало говорящих; повторное размещение набора запрещено условиями Mozilla
OpenSTT20 108 ч; телефония — 812 чзвонки, читка, публичная речь и др.разные способы; телефонная обучающая часть — ASR-разметка, валидационная — ручнаяCC BY-NC; коммерческое использование по соглашениюрепозиторий архивирован; эталоны тестовой части нужно перепроверить
Balalaika5 078 чнесколько типов русской речиавтоматические, ROVER по пяти ASR-гипотезамCC BY-NC-ND 4.0; исходное аудио — по лицензиям источниковбез ручного аудита не служит независимым эталоном ASR
ОРД, СПбГУ1250 ч, 128 информантовживая бытовая и рабочая речь (диктофон 24 ч на человеке)ручные лингвистические, ~10% объёмаакадемический доступконцептуально ближе всего к «русскому AMI»; формат неудобен для ASR
CALLFRIEND Russian Speech100 звонков, около 48 ч, 8 кГцтелефонные диалоги 1999 года; носители русского в СШАтранскрипты лицензируются отдельно как LDC2023T09LDC User Agreement; плата видна после входаустаревший домен и отдельная лицензия на текст
MagicHub ASR-RusCSCкарточка расходится: 1 294 ч в сводке и 985 ч / 591 говорящий в описанииописан одновременно как сценарный и спонтанныйзаявленысобственная лицензия; условия по запросуперед оценкой нужна спецификация поставщика
Nexdata336–338 ч, 460 говорящих; значения на странице расходятсяспонтанные диалогизаявлены; есть образцыкоммерческое предложение по запросусначала проверить образец и уточнить объём
Defined.ai Russian Spontaneous Dialogue1 095 ч в четырёх текущих карточкахмоделируемые диалоги колл-центра: страхование, связь, банки, розницазаявленыкоммерческое предложение по запросуне реальные звонки; объём старой и текущей витрины различается
FutureBee Russian General Conversation30–50 ч и 60–70 участников; разделы страницы расходятсядвухголосые диалоги, стерео с раздельными каналамипоставщик заявляет ручную дословную разметку, двойной контроль и WER < 5%коммерческая лицензия по запросухарактеристики заявлены продавцом; образец нужно запросить
UniData / AxonDataнебольшие публичные превью разных коммерческих предложенийUniData — диалоги; AxonData — записи колл-центрав превьюусловия по запросупо публичным файлам нельзя оценить полный корпус
MaratDVоколо 832 ч звонковтелефонияналичие и формат публично не указаныкоммерческая лицензия; запрет перераспространенияпригодность для оценки нужно подтвердить у поставщика
Аналог AMI среди проверенных каталоговне найденсовещания с несколькими участникаминужны пословные транскрипты и разметка говорящихоткрытые и коммерческие источникирезультат поиска на 29 июля 2026 года, а не утверждение обо всём рынке
Русскоязычные разговорные корпуса, данные на июль 2026 года

Среди свежих релизов, которые мы проверили, GigaAM v3 и T-one публикуются как модели и код, без обучающих корпусов. Это не означает, что компании никогда не открывали данные: например, Сбер публикует корпус Golos объёмом 1 240 часов. В текущей витрине Toloka мы не нашли готового русскоязычного речевого корпуса, но платформа продолжает предлагать сбор аудио и разметку речи на заказ.

Сопоставимого русскоязычного корпуса встреч мы не нашли

AMI Meeting Corpus содержит 100 часов англоязычных встреч, записи с близких и дальних микрофонов и ручные транскрипты с пословными временными метками. Около трети встреч естественные, остальные проходят по ролевым сценариям. Корпус доступен по CC BY. ICSI добавляет около 70 часов встреч с ручными аннотациями, а NOTSOFAR-1 — 315 коротких встреч из 30 конференц-залов.

Среди проверенных открытых и коммерческих каталогов на 29 июля 2026 года мы не нашли русскоязычного корпуса, который одновременно содержит записи совещаний, ручные пословные транскрипты и разметку говорящих. Ближе всего по характеру речи ОРД СПбГУ («Один речевой день»), но ручные расшифровки покрывают около 10% объёма.

В 2026 году авторы описали RusAudioForum: около 20 часов публичных мероприятий, 18 записей и от 3 до 11 говорящих. В работе указаны вручную проверенные временные метки диаризации, но не пословные эталоны ASR, поэтому это полезный многоголосый набор, а не полный аналог AMI. Для наших сценариев встреч и переговорных всё равно потребуется собственная размеченная выборка.

Как мы выбираем данные

К правилам из первой статьи мы добавили следующие:

Схема стенда замеров
Схема стенда — та же, что в первой части; менялись только данные

Замеры увеличивались поэтапно. №1 — смешанная выборка команд и спонтанной речи за 0,49 $ для проверки стенда. №2 — 60 фрагментов спонтанной речи примерно за 2,3 $. №3 — 250 записей продолжительностью до 45 секунд за 4,12 $, на которых обнаружилось зацикливание Nexara. №4 — весь корпус из 491 записи примерно за 8 $. После пересчёта методикой v2 на общем пересечении из 488 записей среди пяти участников этого этапа лучший micro-WER показал faster-whisper large-v3 — 9,78%. После добавления остальных режимов итоговый рейтинг возглавила GigaAM с 7,46%.

Эти замеры последовательно увеличивали размер выборки и длительность записей, но оставались на командах и спонтанных монологах. Для звонков, торговых залов и переговорных нужны отдельные корпуса.

Как выбрать корпус для оценки ASR

  1. Домен совпадает с продуктом? Команды, читка, звонки и встречи — разные задачи; лидер меняется от строки к строке.
  2. Кто делал эталоны и как? Для независимой оценки нужны ручные или перепроверенные эталоны; автоматическую разметку нельзя принимать за независимый тестовый эталон.
  3. Оцените ошибки эталонов. Их вклад должен быть заметно ниже различий, которые вы хотите увидеть.
  4. Дочитайте условия использования до конца: NC, ND, исследовательские соглашения и дополнительные ограничения площадки.
  5. Считайте говорящих, а не только часы. В нашем срезе 3,1 часа распределены между 15 людьми.
  6. Есть ли записи типичной длительности? В нашем замере зацикливание появилось на части записей длиннее 30 секунд, поэтому выборка должна покрывать длительности из продукта.
  7. Акустика соответствует продукту? Телефония 8 кГц, переговорная и торговый зал звучат по-разному: частота дискретизации, каналы, микрофон.
  8. Дата выпуска. Она помогает оценить риск пересечения с обучающими данными, если известны даты их сбора или отсечения.
  9. Воспроизводимость: манифест с контрольными суммами и фиксированное зерно отбора — иначе замер нельзя повторить и нельзя проверить.
  10. Для платных наборов — сначала образец. Перед покупкой проверьте разметку: краткой карточки без доступных данных для оценки недостаточно.

Что дальше

Первая часть: «В нашем тесте лучший движок распознавания русской речи оказался открытым и локальным». Источники: AMI Meeting Corpus · OpenSTT · T-one · Balalaika · ОРД · Common Voice Spontaneous · LDC CALLFRIEND · Nexdata · Defined.ai · FutureBee · MagicHub.