Обзор

Английский, испанский, снова английский: новые модели транскрибации OpenAI

· Дмитрий Бороздин · 4 минуты

28 июля OpenAI выпустила две новые модели транскрибации: gpt-transcribe и gpt-live-transcribe. Предыдущую голосовую линейку — GPT‑Realtime‑2, GPT‑Realtime‑Translate и GPT‑Realtime‑Whisper — компания представила 7 мая этого года, всего за 82 дня до нового релиза.

В новом ролике OpenAI спикер говорит по-английски, переходит на испанский и возвращается к английскому. Расшифровка продолжает идти без ручного переключения языка.

В ролике смену языка на лету показывает gpt-live-transcribe. Файловая gpt-transcribe тоже поддерживает многоязычные записи и смену языка внутри речи.

Что умеют новые модели

Критерий gpt-transcribe gpt-live-transcribe
Когда использовать Запись уже готова Человек говорит прямо сейчас
Примеры Встречи, интервью, подкасты, архив звонков Живые субтитры, звонки, голосовые интерфейсы
Смена языка в речи Поддерживается Поддерживается и показана в ролике OpenAI
Возвращает список распознанных языков Да, если уверена Нет
Цена $0,0045 за минуту $0,017 за минуту
Файловая модель рассчитана на итоговый текст, живая — на выдачу по ходу речи.

gpt-transcribe рассчитана на точный итоговый текст из готового файла. Она также может обработать завершённую реплику в Realtime-сессии, когда человек уже закончил говорить.

gpt-live-transcribe присылает текст по ходу речи. Задержку можно настраивать: более ранняя выдача даёт быстрые субтитры, дополнительный аудиоконтекст помогает модели увереннее распознавать фразу. OpenAI не обещает одинаковое число миллисекунд для всех записей, поэтому скорость придётся проверять на своих микрофонах и звонках.

Синхронный перевод речи на другой язык выполняет отдельная модель gpt-realtime-translate, представленная в мае.

Контекст, термины и языки

Обеим новым моделям можно заранее сообщить тему разговора, важные имена, названия продуктов, профессиональные термины и ожидаемые языки. Для встречи о CRM можно передать слова «RetailCRM», «LTV» и названия клиентов. Для медицинской записи — термины, которые обычно искажает обычная диктовка.

Это особенно полезно в русской речи, где постоянно встречаются английские названия, сокращения и артикулы. Подсказки не гарантируют правильный результат, но дают модели контекст ещё до расшифровки.

OpenAI опубликовала и собственные замеры. На Common Voice по 22 языкам показатель ошибки gpt-transcribe составил 19,27%. В том же графике указан только whisper-1 с 40,37%. Более современная файловая модель gpt-4o-transcribe доступна в API, но OpenAI не приводит её результат на той же выборке Common Voice по 22 языкам. Поэтому график показывает прогресс относительно Whisper, но не относительно предыдущего поколения моделей.

Для live-модели сравнение уместнее: 19,70% против 20,33% у gpt-realtime-whisper, выпущенной 7 мая. Чем меньше значение, тем лучше. Это результаты самой OpenAI; на русских звонках прирост может быть другим.

Сколько это стоит

По текущим ценам OpenAI:

Живая модель стоит почти в 3,8 раза дороже файловой. Доплата имеет смысл там, где текст нужен во время разговора. Для архива записей разумнее начинать с gpt-transcribe.

Что новые модели пока не заменяют

В новой паре нет меток спикеров и временных меток для каждого слова. Если нужно разделить участников разговора, у OpenAI остаётся gpt-4o-transcribe-diarize. Для точных таймкодов и готовых файлов субтитров srt или vtt пока нужен whisper-1.

Смена модели поэтому не всегда сводится к одному новому названию в настройках. Сначала стоит проверить, какие данные использует продукт после расшифровки.

Как выбирать

Для загруженных встреч, интервью, подкастов и архива звонков — gpt-transcribe.

Для субтитров во время выступления, операторской линии и текста из микрофона — gpt-live-transcribe.

Если в речи смешиваются русский и английский или английский и испанский, подходят обе модели. Выбор определяет источник звука: готовая запись или живой разговор. Только gpt-transcribe дополнительно сообщает, какие языки она обнаружила; gpt-live-transcribe такого списка не возвращает.

Первоисточники

Работаете с транскрибацией? Отправьте коллегам статью о новых моделях OpenAI.