Аудио и речь
28 июля 2026
OpenAI выпустила две модели для транскрибации аудио
Р
Редакция New-ZZZ
X @OpenAIDevs · 1 неделю назад
OpenAI представила в API две модели распознавания речи. GPT-Live-Transcribe предназначена для транскрибации в реальном времени с низкой задержкой, а GPT-Transcribe — для обработки готовых аудиофайлов и пакетных заданий.
Модели лучше распознают разные языки и акценты, короткие фразы, числа, профессиональные термины и речь при сильном фоновом шуме. Разработчики могут передавать системе описание записи, ключевые слова, ожидаемые языки и предыдущие реплики.
Дополнительный контекст повысил семантическую точность GPT-Transcribe в тесте Context Aware ASR с 41,6% до 45,2%. На многоязычном наборе Common Voice модель показала уровень ошибок транскрипции 19,27%.
Почему это важно
- —Разработчики получили отдельные модели для живого распознавания речи и обработки готовых записей.
- —Передача контекста помогает точнее распознавать имена, числа и профессиональные термины.
- —Поддержка разных языков, акцентов и шумных записей расширяет применение голосовых сервисов.
Ключевые факты
- GPT-Live-Transcribe работает с аудио в реальном времени и рассчитана на низкую задержку.
- GPT-Transcribe оптимизирована для готовых файлов и пакетной обработки.
- Разработчики могут передавать описание записи, ключевые слова, языки и предыдущие реплики.
- В Context Aware ASR контекст повысил точность с 41,6% до 45,2%.
- На Common Voice для 22 языков уровень ошибок составил 19,27%.
Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.