Alibaba Qwen-Audio-3.1: полный аудиостек с эмоциональным ответом и многоспикерным распознаванием
Alibaba представила Qwen-Audio-3.1 — комплексный и полностью обновленный аудиостек, который охватывает все этапы работы со звуком: от распознавания до генерации. В набор вошло пять моделей, включая новые компоненты TTS-Next и ASR-Next.
Система значительно улучшила возможности распознавания речи (ASR), добавив многоязычное и диалектное распознавание с функцией автоматической полировки, которая очищает транскрипты от лишних слов и повторений.
Новые модели позволяют создавать высококачественный контент: TTS-Next генерирует голос, звуковые эффекты и фоновое аудио за один проход, что идеально подходит для подкастов и аудиокниг. Кроме того, Realtime-модуль имитирует реальный разговор, отвечая с эмпатией и замедляя темп речи в зависимости от эмоционального состояния собеседника. Это делает Qwen-Audio-3.1 мощным инструментом не только для транскрипции, но и для создания эмоционально насыщенного аудиоконтента.
Почему это важно
- —Предлагает полный цикл обработки аудио (ASR, TTS, Realtime) в одной экосистеме.
- —Внедрение эмоционального интеллекта в Realtime-взаимодействие, что повышает качество пользовательского опыта.
- —Улучшенное многоспикерное распознавание (ASR-Next) с метками эмоций и звуков, полезное для локализации событий и QA.
Ключевые факты
- ASR-Next поддерживает многоспикерное распознавание с временными метками и анализом эмоций.
- TTS-Next использует унифицированную LM и диффузионную архитектуру для генерации аудиокниг и подкастов.
- Realtime-модуль имитирует естественный диалог, включая эмоциональную реакцию и возможность прерывания.
- ASR получил функцию полировки, автоматически удаляющую слова-паразиты и повторения.
- Вся линейка моделей доступна со значительными скидками.
Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.