New-ZZZ
RU / EN
Аудио и речь 3 августа 2026

OpenAI перестроила голосовой ИИ вокруг полнодуплексного общения

Р
Редакция New-ZZZ
OpenAI Blog · 5 дней назад

Голосовая система OpenAI третьего поколения, GPT-Live, призвана решить одну из самых сложных проблем разговорного ИИ: определять, когда система должна говорить. Люди естественным образом передают друг другу очередь в разговоре за доли секунды, ориентируясь на паузы, ритм, тон и контекст. Более ранние голосовые ассистенты вместо этого полагались на небольшие модели — «детекторы очереди», которые пытались угадать, закончил ли человек говорить. Если детектор срабатывал слишком рано, ассистент перебивал пользователя; если ждал слишком долго, разговор казался медленным. Основная языковая модель могла начать работу только после того, как отдельный детектор принимал решение.

GPT-Live заменяет эту прерывистую схему полнодуплексной голосовой моделью, способной одновременно слушать и говорить. Полнодуплексный режим важен, поскольку благодаря ему взаимодействие больше похоже на непрерывный разговор, чем на последовательность записанных сообщений. Аудио может непрерывно поступать в модель и передаваться из неё, не дожидаясь, пока отдельный компонент объявит об окончании очередной реплики. Такой подход призван сделать взаимодействие быстрее, отзывчивее и лучше согласовать его с естественным темпом человеческой речи.

Более ранние голосовые системы во многом унаследовали структуру чередования реплик у текстовых языковых моделей. В традиционном каскадном конвейере система распознавания речи сначала преобразовывала аудио в текст, затем LLM генерировала ответ, после чего система синтеза речи снова превращала этот ответ в аудио. Последовательное выполнение этих этапов создавало задержку и приводило к потере выразительной информации, например темпа и интонации. Модели прямого преобразования речи в речь улучшили ситуацию, поскольку стали нативно понимать и генерировать аудио, сохраняя больше таких сигналов и сокращая время обработки, однако для запуска инференса им по-прежнему требовался детектор очереди.

В GPT-Live голосовая модель, напротив, находится в центре разговора. Её важнейшая задача — поддерживать непрерывный цикл, в котором входящая речь поступает в модель, а сгенерированная речь возвращается пользователю. Более ресурсоёмкая работа — в том числе углублённые рассуждения, вызовы инструментов и обращение к передовым моделям, таким как GPT-5.5, — выполняется асинхронно за пределами этого цикла взаимодействия в реальном времени. Благодаря этому система может искать более качественный ответ или выполнять действие, не замораживая аудиоканал разговора на время обработки вторичной задачи.

Архитектурный прорыв заключается не просто в создании более быстрой модели, а в отделении медиапотока реального времени от более медленной логики приложения. Аудио передаётся между клиентом и голосовой моделью по выделенному быстрому каналу. Использование инструментов, делегирование, обработка политик, серверные операции и сохранение истории разговора находятся за асинхронной границей удалённого вызова процедур. Если инструмент или серверная служба отвечает медленно, задерживается только её собственный результат, но эта задержка не должна останавливать дальнейшее прохождение аудиофреймов через систему.

Такое разделение также создаёт удобную границу для кастомизации. Разработчики могут менять инструменты, политики или серверную логику приложения, не затрагивая медийный фронтенд, обеспечивающий отзывчивость разговора. Если путь обработки в реальном времени остаётся небольшим и предсказуемым, сокращается количество компонентов, способных вызывать заметные на слух паузы. Кроме того, функции приложения могут развиваться независимо от чувствительной к задержкам инфраструктуры, отвечающей за передачу речи.

Непрерывная передача аудио предъявляет более строгие инженерные требования, чем обмен отдельными репликами. Система, обрабатывающая разрозненные аудиофрагменты, может допускать некоторый разброс во времени их поступления. В цикле обработки медиапотока в реальном времени отдельные аудиофреймы должны доставляться строго по расписанию: задержки при передаче по сети, обработке или инференсе могут сразу же проявиться в виде заметных пауз, сбоев и других артефактов. Поэтому отзывчивость необходимо обеспечивать на всём пути прохождения данных, а не только улучшать модель или клиент.

OpenAI опиралась на инфраструктуру, ранее разработанную для ChatGPT Voice и Realtime API, которые уже обеспечивали потоковую передачу аудио и видео с меньшей и более предсказуемой задержкой. GPT-Live развивает этот подход, передавая медиапоток непосредственно в модель через новую систему инференса с сохранением состояния. «С сохранением состояния» означает, что слой инференса поддерживает непрерывную сессию разговора, а не обрабатывает каждую реплику пользователя как отдельный запрос. Такая непрерывность крайне важна для модели, которая должна оставаться вовлечённой на протяжении всего естественно развивающегося диалога.

Сохранение состояния также создаёт дополнительные сложности при эксплуатации. Платформа должна надёжно передавать аудио от клиента в стек инференса, сохранять релевантный контекст разговора и поддерживать согласованность сессии, пока несколько процессов выполняются одновременно. По словам OpenAI, шестимесячная инженерная работа потребовала изменений в инференсе модели, управлении контекстом, передаче медиаданных и делегировании. Медийный фронтенд и логика инференса были написаны на Go, заменив более раннюю реализацию на Python с использованием asyncio, хотя предоставленный фрагмент источника заканчивается до подробного объяснения этой миграции.

Объединяя постоянно активную голосовую модель с асинхронным доступом к более мощным моделям рассуждений и инструментам, GPT-Live стремится одновременно обеспечить мгновенную реакцию в разговоре и более глубокий интеллект. Эта архитектура уже поддерживает возможности ChatGPT Voice, включая недавно запущенную функцию управления компьютером и координации агентов через настольное приложение ChatGPT. В более широком смысле она закладывает основу для голосовых приложений, способных сохранять отзывчивость при выполнении сложной работы в фоновом режиме, приближая взаимодействие с ИИ к плавному ритму, которого люди ожидают от живого разговора.

Почему это важно

  • Полнодуплексный звук позволяет голосовой модели одновременно слушать и говорить, сокращая количество перебиваний и неловких задержек, возникающих из-за отдельных детекторов очередности реплик.
  • Отделение медиапотока в реальном времени от инструментов и бизнес-логики позволяет приложениям выполнять сложные задачи, не приостанавливая разговор.
  • Эта архитектура создаёт масштабируемую основу для отзывчивых голосовых ассистентов, способных рассуждать, использовать инструменты, управлять компьютерами и координировать работу агентов.

Ключевые факты

  • GPT-Live устраняет отдельный детектор очередности реплик из тракта обработки звука и передаёт голосовой модели управление темпом разговора.
  • Входящий и исходящий звук передаются по выделенному каналу реального времени, а рассуждения, вызовы инструментов, делегирование и сохранение состояния выполняются асинхронно.
  • GPT-Live может обращаться к передовым моделям, таким как GPT-5.5, не прерывая разговор в реальном времени.
  • За шесть месяцев OpenAI заново разработала системы инференса, управления контекстом и передачи медиаданных, реализовав медиафронтенд и логику инференса на Go.
  • Система поддерживает функции ChatGPT Voice, включая управление компьютером и координацию агентов в настольном приложении.
Читать первоисточник

Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.

/ похожие материалы