New-ZZZ
RU / EN
Аудио и речь 28 июля 2026

OpenAI выпустила две модели для транскрибации аудио

Р
Редакция New-ZZZ
X @OpenAIDevs · 1 неделю назад

OpenAI представила в API две модели распознавания речи. GPT-Live-Transcribe предназначена для транскрибации в реальном времени с низкой задержкой, а GPT-Transcribe — для обработки готовых аудиофайлов и пакетных заданий.

Модели лучше распознают разные языки и акценты, короткие фразы, числа, профессиональные термины и речь при сильном фоновом шуме. Разработчики могут передавать системе описание записи, ключевые слова, ожидаемые языки и предыдущие реплики.

Дополнительный контекст повысил семантическую точность GPT-Transcribe в тесте Context Aware ASR с 41,6% до 45,2%. На многоязычном наборе Common Voice модель показала уровень ошибок транскрипции 19,27%.

Почему это важно

  • Разработчики получили отдельные модели для живого распознавания речи и обработки готовых записей.
  • Передача контекста помогает точнее распознавать имена, числа и профессиональные термины.
  • Поддержка разных языков, акцентов и шумных записей расширяет применение голосовых сервисов.

Ключевые факты

  • GPT-Live-Transcribe работает с аудио в реальном времени и рассчитана на низкую задержку.
  • GPT-Transcribe оптимизирована для готовых файлов и пакетной обработки.
  • Разработчики могут передавать описание записи, ключевые слова, языки и предыдущие реплики.
  • В Context Aware ASR контекст повысил точность с 41,6% до 45,2%.
  • На Common Voice для 22 языков уровень ошибок составил 19,27%.
Читать первоисточник

Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.

/ похожие материалы