VoiceEQ проверяет, действительно ли голосовой ИИ звучит как человек
Голос быстро становится одним из основных способов взаимодействия людей с ИИ в клиентском обслуживании, здравоохранении, образовании, индустрии развлечений и сфере персональных помощников. Хотя системы обработки речи значительно продвинулись в точности расшифровки и скорости ответа, традиционные бенчмарки не учитывают многие качества, от которых зависит, воспринимается ли взаимодействие как надёжное и человечное. Система может демонстрировать низкий уровень ошибок в распознавании слов, но при этом менять воспринимаемую личность говорящего во время разговора, не замечать заминки, плохо справляться с акцентами или давать сбои, когда речь эмоциональна либо окружена шумом. Real World VoiceEQ предназначен для измерения акустической и разговорной информации, которая исчезает при сведении речи к письменной расшифровке.
Бенчмарк оценивает, способны ли голосовые системы распознавать и генерировать тон, эмоции, личность говорящего, темп, акценты, громкость и контекст окружающей среды, а также должным образом на них реагировать. Он охватывает более 40 ведущих проприетарных моделей и моделей с открытым исходным кодом, свыше 15 направлений оценки и более 60 метрик. В его область входят автоматическое распознавание речи, синтез речи из текста, прямое взаимодействие «речь — речь» и более широкое понимание речи. Вместо того чтобы рассматривать качество голоса как единую проблему, фреймворк разделяет способности, необходимые для точного восприятия человека, создания убедительной речи, понимания невербальных сигналов и формирования уместного в конкретном контексте ответа.
Real World VoiceEQ был создан на основе более миллиона отдельных оценок, полученных от людей из разных демографических групп и охватывающих различные стили речи и акустические условия. Текущая версия бенчмарка включает 785 000 оценок синтеза речи из текста и 48 000 оценок взаимодействия «речь — речь», что делает его одним из крупнейших на сегодняшний день описанных исследований голосового ИИ с участием людей. Оценки проводились с помощью Kairos — платформы, изначально ориентированной на голосовые технологии и также поддерживающей индивидуальное тестирование для ИИ-лабораторий и предприятий. Платформа предназначена для выявления конкретных сбоев в реальных условиях эксплуатации, сбора данных о предпочтениях людей и поддержки непрерывного совершенствования моделей посредством обучения с подкреплением и обратной связи от людей.
Результаты ставят под сомнение представление о том, что одну голосовую модель можно признать безоговорочно лучшей во всех отношениях. Ведущие системы оптимизированы под разные сильные стороны, включая техническую точность, интерпретацию эмоций, принятие решений в разговоре, выразительность и устойчивость в сложных условиях. Модель, способная безошибочно повторять номера бронирований, финансовые сведения или сложную фармацевтическую терминологию, может не уметь создавать эмоционально убедительную речь. И наоборот, очень естественная и выразительная модель может оказаться менее надёжной там, где критически важна точность формулировок. При оценке синтеза речи из текста ни одна конфигурация не вошла в пятёрку лучших по всем восьми группам возможностей. Поэтому формирующийся рынок правильнее рассматривать как совокупность специализированных голосовых возможностей, а не как гонку за звание единственного универсального победителя.
Модели взаимодействия «речь — речь» продемонстрировали наибольшие различия среди оцениваемых категорий. Некоторые из них эффективно распознавали эмоции, но не могли сформулировать естественный ответ. В более широком смысле получение аудио на входе ещё не означало, что агент действительно использовал доступную информацию, выходящую за рамки расшифровки. По всей видимости, несколько систем по-прежнему ориентировались преимущественно на произнесённые слова, игнорируя тон, заминки, темп, акценты и громкость. Люди постоянно используют эти сигналы, чтобы распознавать неуверенность, уверенность, раздражение, сарказм или эмпатию, однако современные голосовые модели зачастую не учитывают их в своей интерпретации и поведении.
Эта проблема имеет прямые практические последствия. Если банковский помощник спрашивает клиента, узнаёт ли он подозрительную транзакцию, уверенный утвердительный ответ и неохотный утвердительный ответ с заминкой могут иметь совершенно разные значения, хотя их расшифровка будет одинаковой. Человек мгновенно замечает это различие, тогда как многие голосовые системы обрабатывают такие ответы как равнозначные. Этот разрыв показывает, почему одной лишь точности расшифровки недостаточно, чтобы определить, способен ли ИИ-агент достаточно внимательно слушать собеседника в деликатных разговорах, происходящих в реальных условиях.
Существующие публичные бенчмарки также приближаются к насыщению и зачастую не воспроизводят условия, с которыми голосовые продукты сталкиваются после внедрения. Системам по-прежнему сложно работать с акцентами, эмоциональной речью, фоновым шумом, одновременной речью нескольких людей и продолжительными разговорами. Real World VoiceEQ выявил значительно бо́льшие различия между известными открытыми и проприетарными моделями, чем можно предположить по традиционным оценкам. В одном из тестов уровень ошибок в распознавании слов для речи, смешанной с шумом, оказался примерно в четыре раза выше, чем для речи на фоне музыки. Объединение обоих условий в одну общую метрику фонового аудио скрыло бы конкретную слабость.
Предварительное исследование также выявило признаки того, что некоторые модели могли быть оптимизированы под знакомые публичные тестовые наборы, а не под саму задачу. Некоторые из них повторяли известные ошибки из эталонных расшифровок бенчмарков, перенимали произвольные правила написания из этих расшифровок или восстанавливали скрытые слова, которые невозможно было услышать в предоставленной записи. Такое поведение заставляет сомневаться в том, всегда ли высокие результаты в бенчмарках отражают реальную способность распознавать речь.
Авторы также призывают с осторожностью использовать речевые языковые модели в качестве автоматических судей при оценке голосового вывода. Большие языковые модели уже широко применяются для оценки текстовых систем, однако оценка голоса требует чувствительности к акустическим характеристикам, которые могут остаться незамеченными при подходе, ориентированном на текст. В источнике сообщается о сравнении ведущих речевых языковых моделей с подготовленными экспертами-оценщиками при анализе синтеза речи из текста, однако предоставленный отрывок заканчивается до раскрытия полных результатов их согласованности. Более общий вывод заключается в том, что достоверная оценка голоса должна сохранять роль человеческого суждения и проверять отдельные способности в реалистичных акустических и разговорных условиях.
Почему это важно
- —Он оценивает тон, эмоции, заминки, идентичность говорящего и акустический контекст — аспекты, которые обычно не учитываются в бенчмарках на основе транскрипций.
- —Большой массив оценок, выставленных людьми, показывает, что ведущие голосовые модели обладают специализированными преимуществами, а универсально лучшей конфигурации не существует.
- —Результаты выявляют недостатки в реальных условиях, скрытые за предельными показателями устоявшихся бенчмарков, включая проблемы с шумом, акцентами, эмоциями и разговорными сигналами.
Ключевые факты
- Real World VoiceEQ оценивает более 40 проприетарных моделей и моделей с открытым исходным кодом по более чем 15 параметрам и 60 метрикам.
- Бенчмарк опирается более чем на один миллион оценок, выставленных людьми, включая 785 000 оценок систем преобразования текста в речь и 48 000 оценок систем преобразования речи в речь.
- Ни одна из протестированных конфигураций преобразования текста в речь не вошла в пятёрку лучших во всех восьми группах возможностей.
- Результаты систем преобразования речи в речь сильно различались, при этом модели часто игнорировали тон, темп, заминки, интонационные акценты и громкость, несмотря на получение аудио на входе.
- В одном из тестов количество ошибок транскрипции речи на фоне шума было примерно в четыре раза выше, чем речи на фоне музыки.
Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.