New-ZZZ
RU / EN
Аудио и речь 7 октября 2026

TII представляет Falcon-ASR: передовое распознавание речи для эмиратского арабского диалекта

Р
Редакция New-ZZZ
Hugging Face Blog · 1 час назад

Falcon-ASR — это недавно разработанная передовая модель распознавания речи, созданная Technology Innovation Institute (TII) в Абу-Даби. Эта модель специально разработана для арабского языка с явным и критическим акцентом на точное транскрибирование эмиратского диалекта. Помимо этого основного фокуса, Falcon-ASR демонстрирует надежные мультиязычные возможности, поддерживая английский, французский, испанский и португальский языки. Модель построена на архитектуре и методологиях обучения, разработанных в рамках работы Falcon3-Audio, что указывает на сложный фундамент в области аудио-языкового моделирования.

Одним из наиболее значимых аспектов этого объявления являются метрики производительности модели. В ходе оценки по шести стандартизированным арабским тестовым наборам Falcon-ASR достигла среднего показателя частоты ошибок слов (WER) в 20,92%. Эта цифра представляет собой заметное улучшение, поскольку она значительно превосходит лучший опубликованный результат, зафиксированный в снимке таблицы лидеров, использованной для сравнения, который составил 23,17%. Кроме того, производительность модели на Open Universal Arabic ASR Leaderboard, поддерживаемой ELM Research Center, была оценена по стандартному протоколу, подтвердив, что ее средний WER на 2,25 процентных пункта лучше, чем лучший опубликованный результат в этом конкретном снимке. WER и частота ошибок символов (CER) являются ключевыми метриками в распознавании речи, где более низкие значения свидетельствуют о превосходной точности, указывая на меньшее количество ошибок при транскрибировании устных слов или символов.

Однако истинная глубина возможностей Falcon-ASR раскрывается во внутренней эмиратской оценке. Признавая, что арабская речь очень вариативна — сильно различается в зависимости от региона, говорящего и условий записи — TII провел тщательную внутреннюю оценку. В этой специализированной эмиратской оценке Falcon-ASR зафиксировала WER 22,73% и CER 10,19%. Критически важно, что модель достигла самого низкого WER и CER среди всех систем, сравненных в этом внутреннем бенчмарке. Эта производительность особенно впечатляет, поскольку условия оценки были намеренно сложными и включали симуляцию фонового шума, наложения речи, музыки, реверберации помещения и распространенных телефонных эффектов. Это комплексное тестирование гарантирует, что модель надежна для реальных повседневных записей, таких как те, что встречаются на совещаниях или телефонных звонках, а не только для чистых, официальных трансляций.

Команда разработчиков осветила присущие трудности в обработке арабской речи. Они подчеркнули, что диалектный арабский обладает меньшим количеством транскрибированных ресурсов по сравнению с Современным стандартным арабским языком (MSA), что делает как обучение, так и объективную оценку существенно более сложными. Чтобы преодолеть это, Falcon-ASR была обучена на разнообразной смеси данных, охватывающей эмиратский, MSA, различные другие диалекты Персидского залива и арабские диалекты, а также английский язык. Основная цель этого обширного режима обучения — точно транскрибировать естественные повседневные речевые паттерны, используемые людьми, включая сложные лингвистические явления диалектных форм и переключение кодов (переход между языками во время речи).

Помимо основного арабского фокуса, универсальность модели является главным козырем. Она поддерживает английский, французский, испанский и португальский языки, используя тот же набор весов для всех пяти языков, что исключает необходимость в языкоспецифическом флаге. Для английского языка модель достигла среднего WER в 5,74% по семи публичным тестовым наборам, используемым в Hugging Face Open ASR Leaderboard. Более того, система предоставляет расширенный функционал, включая временные метки на уровне слов, которые связывают каждое транскрибированное слово с его точным положением в исходном аудиофайле — функция, бесценная для детальной транскрипции и анализа.

Способность выполнять высокоточную транскрипцию на нескольких различных языках и в сложных реальных акустических условиях знаменует собой значительный скачок в области обработки речи на базе ИИ. Внутренняя оценка дополнительно продемонстрировала превосходную производительность модели, показав, что ее WER был на 4,07 процентных пункта ниже, чем у ближайшего конкурента, Qwen3-Omni. Такой уровень детализации тестирования — включая использование отложенных записей и транскрипций, подтвержденных человеком, помимо публичного подмножества ОАЭ — подтверждает надежность модели и ее высокий уровень точности транскрипции как на уровне слов, так и на уровне символов. Разработка и развертывание модели через Hugging Face Demo Space, с запланированным доступом по API и нативными приложениями, сигнализирует о ее немедленной доступности для разработчиков и предприятий, стремящихся интегрировать передовое распознавание речи в свои продукты. Общие усилия представляют собой крупный вклад в обеспечение доступности передовых, учитывающих диалекты, технологий речи для более широкого круга пользователей и приложений.

Почему это важно

  • —Он устанавливает новый эталон точности ASR, особенно для сложных, недостаточно представленных диалектов, таких как эмиратский арабский.
  • —Строгая внутренняя методология тестирования (шум, перекрытие, реверберация) доказывает применимость в реальном мире, намного превосходя стандартные эталоны.
  • —Его многоязычная возможность (арабский, английский, французский, испанский, португальский) с использованием унифицированных весов делает его очень универсальным для глобального корпоративного использования.

Ключевые факты

  • Достиг среднего WER в 20,92% на шести тестовых наборах арабского языка, опередив опубликованный лучший результат на 2,25 процентных пункта.
  • В внутренней эмиратской оценке он зафиксировал самый низкий WER (22,73%) и CER (10,19%) среди сравниваемых систем.
  • Обучен на разнообразной смеси диалектов (эмиратский, MSA, Персигивский залив и т.д.) для обработки повседневной речи и переключения кодов.
  • Поддерживает пять языков (арабский, английский, французский, испанский, португальский) с использованием одних и тех же весов модели.
  • Предоставляет временные метки на уровне слов, связывая транскрибированные слова с их точным положением в аудио.
Читать первоисточник →

Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.

/ похожие материалы