Google AI представила две продвинутые модели TTS Gemini 3.8 Flash
Google AI представила две новые, высоковыразительные модели синтеза речи (TTS): Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Эти инструменты позволяют создавать аудиоконтент на более чем 100 языках, предлагая выбор из 2000+ готовых голосов.
Пользователи получают расширенный контроль над диалогом, включая возможность управлять подачей построчно и добавлять естественные голосовые подсказки (например, имитация звуков «м-м-м»), что критически важно для генерации длинного, непрерывного и качественного аудио.
Модели разделены по задачам: Gemini 3.8 Flash TTS предназначен для высококачественного креативного контента (игры, подкасты), где требуется создание уникальных вокальных персонажей с детальным контролем. В то время как Gemini 3.8 Flash-Lite TTS — это масштабируемый движок для массового дубляжа и голосовых агентов, который автоматически подстраивает тон и темп в режиме реального времени с низкими затратами.
Почему это важно
- —Повышение качества генерации речи: Новые модели обеспечивают бесшовное и высокоэкспрессивное аудио, подходящее для профессионального использования.
- —Специализация моделей: Разделение на Flash (креатив) и Flash-Lite (масштаб) позволяет пользователям выбирать инструмент в зависимости от задачи — от уникального персонажа до массового дубляжа.
- —Расширенный контроль: Возможность построчного управления диалогом и добавление естественных пауз значительно повышает реалистичность создаваемого контента.
Ключевые факты
- Модели поддерживают более 100 языков и предлагают выбор из 2000+ готовых голосов.
- Gemini 3.8 Flash TTS идеален для создания уникальных персонажей в играх и подкастах.
- Gemini 3.8 Flash-Lite TTS оптимизирован для масштабирования, массового дубляжа и работы голосовых агентов в реальном времени.
- Функционал включает управление диалогом построчно и добавление естественных голосовых подсказок.
Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.