TII 发布 1.6B 参数语音识别模型 Falcon-ASR,聚焦阿拉伯语与阿联酋方言
Introducing Falcon ASR
TII 在阿布扎比发布 Falcon-ASR,一个 1.6B 参数语音识别模型,重点关注阿联酋方言,同时支持英语、法语、西班牙语和葡萄牙语。

阿拉伯语 WER:20.92% · 参数量:1.6B · 阿联酋方言 WER(TII 评估):22.73%
我们推出 Falcon-ASR,这是我们面向阿拉伯语的 16 亿参数语音识别模型,特别侧重于阿联酋方言。该模型由阿布扎比技术创新研究院(TII)开发,同时支持英语、法语、西班牙语和葡萄牙语。
在我们的评估中,Falcon-ASR 在六个阿拉伯语测试集上的平均词错误率为 20.92%,而我们所用的排行榜快照中已公布的最佳结果为 23.17%。在我们内部的阿联酋方言评估中,它在所比较的系统中取得了最低的词错误率和字符错误率。
我们还为转录提供词级时间戳,将每个转录出的词与其在音频中的位置关联起来。
你可以在我们的 Hugging Face Demo 中试用 Falcon-ASR。
识别阿拉伯语语音
阿拉伯语语音因地区、说话人和场景而异。能处理正式新闻广播的模型,在处理阿联酋方言对话或通过电话线路录制的语音时仍可能表现不佳。此外,方言阿拉伯语比现代标准阿拉伯语(MSA)拥有更少的转录资源,这使得训练和评估更加困难。
我们用阿联酋方言、现代标准阿拉伯语(MSA)、其他海湾及阿拉伯语方言以及英语训练了 Falcon-ASR。我们的目标是转录人们在日常口语中使用的词语,包括方言形式和语言之间的切换。
阿拉伯语基准测试结果
由 ELM 研究中心维护的 Open Universal Arabic ASR Leaderboard 按六个测试集等权平均 WER 对系统进行排名,同时报告字符错误率(CER)。两项指标均为数值越低越好。我们对 Falcon-ASR 的评估遵循这一协议。
| 模型 | 参数量 | 平均 WER (%) | 平均 CER (%) |
|---|---|---|---|
| Falcon-ASR | 1.6B | 20.92 | 8.79 |
| Audar-ASR-V1-Turbo | 2.35B | 23.17 | 9.23 |
| Cohere Transcribe Arabic (07-2026) | 2.0B | 25.87 | 11.80 |
| omniASR LLM 7B | 7.0B | 28.32 | 12.52 |
WER = 词错误率;CER = 字符错误率。数值越低表示性能越好。
我们使用排行榜固定的清单在相同的六个基准上评估了 Falcon-ASR。竞争对手的数据为 2026 年 9 月 30 日核对的已公布排行榜平均值。Falcon-ASR 的平均 WER 比该快照中的最佳已公布结果好 2.25 个百分点。
评估阿联酋方言语音
公开评估数据已包含阿联酋方言:Casablanca 含有一个阿联酋子集。我们通过内部评估补充这一覆盖范围,对额外的阿联酋及海湾地区语音进行评估,使用留出的录音和经人工校验的转录文本,以在公开的阿联酋子集之外评估转录准确度。
在我们内部的阿联酋方言评估中,Falcon-ASR 取得了 22.73% 的 WER 和 10.19% 的 CER:
| 模型 | 参数量 | WER (%) | CER (%) |
|---|---|---|---|
| Falcon-ASR | 1.6B | 22.73 | 10.19 |
| Qwen3-Omni-30B-A3B-Instruct | 30.0B (3.0B active) | 26.80 | 12.72 |
| Audar-ASR-V1-Turbo | 2.35B | 27.89 | 13.75 |
| Cohere Transcribe Arabic (07-2026) | 2.0B | 31.05 | 18.07 |
| Qwen3-ASR-1.7B-hf | 2.0B | 31.52 | 13.35 |
| Audar-ASR-V1-Flash | 0.78B | 32.87 | 15.36 |
Falcon-ASR 在此处比较的系统中拥有最低的 WER 和 CER。其 WER 比次佳结果 Qwen3-Omni 低 4.07 个百分点。结果显示,在该评估中,词级和字符级的转录准确度均有所提升。
针对不同录音条件的训练
我们加入了背景噪声、重叠语音、音乐、房间混响和电话效应,以及语速和音高的变化。我们对阿联酋录音也做了同样的处理,让模型接触它在会议、通话和其他日常录音中可能遇到的各种条件。
英语及其他语言
Falcon-ASR 还能用同一套模型权重转录英语。在使用 Hugging Face Open ASR Leaderboard 的七个公开英语测试集进行评估时,它取得了 5.74% 的平均 WER。
| 测试集 | WER (%) |
|---|---|
| LibriSpeech clean | 1.75 |
| LibriSpeech other | 4.21 |
| SPGISpeech | 2.02 |
| VoxPopuli | 3.87 |
| GigaSpeech | 8.15 |
| AMI | 8.33 |
| Earnings-22 | 11.86 |
该模型还支持法语、西班牙语和葡萄牙语。这五种语言都使用相同的权重,无需指定语言标志。输出即为所讲语言的转录文本。
模型基础
Falcon-ASR 基于我们的 Falcon3-Audio 工作构建。Falcon3-Audio 的架构和训练方法在 Competitive Audio-Language Models with Data-Efficient Single-Stage Training on Public Data 中有详细介绍。
试用 Falcon ASR
我们的 Hugging Face Demo Space 让您可以试用 Falcon-ASR 并探索其转录能力。API 访问和原生应用也在计划中。我们诚邀您用自己的录音来试用这个 Demo。
我们推出 Falcon ASR
我们推出 Falcon-ASR,这是我们针对阿拉伯语语音识别的 16 亿参数模型,特别关注阿联酋方言。该模型由位于阿布扎比的技术创新研究院(TII)开发,同时支持英语、法语、西班牙语和葡萄牙语。
在我们的评估中,Falcon-ASR 在六个阿拉伯语测试集上的平均词错率为 20.92%,而我们所用排行榜版本中已发布的最佳结果为 23.17%。在我们针对阿联酋方言的内部评估中,该模型在我们对比的系统中取得了最低的词错率和字符错误率。
ندعم أيضاً الطوابع الزمنية على مستوى الكلمات في عمليات التفريغ النصي، بحيث ترتبط كل كلمة بموضعها في التسجيل الصوتي.
您可以通过我们在 Hugging Face 上的演示空间 试用 Falcon-ASR。
التعرف على العربية المنطوقة
يختلف الكلام العربي باختلاف المنطقة والمتحدث وظروف التسجيل. فقد ينجح نموذج في تفريغ نشرة إخبارية رسمية، ثم يجد صعوبة في تفريغ محادثة باللهجة الإماراتية أو تسجيل عبر الهاتف. كما أن الموارد الصوتية المفرّغة نصيًا للهجات العربية أقل من تلك المتاحة للعربية الفصحى، مما يزيد صعوبة التدريب والتقييم.
我们用阿联酋方言、现代标准阿拉伯语以及其他海湾和阿拉伯方言训练了 Falcon-ASR,同时也涵盖了英语。我们的目标是转录人们日常对话中使用的语言,包括方言形式和语码转换。
نتائج الاختبارات العربية
由 ELM 研究中心管理的 综合阿拉伯语语音识别开放排行榜 按照六个测试集的平均词错率对系统进行排名,每个测试集权重相同。它还展示字符错误率(CER)。两个指标的数值越低,表现越好。我们对模型的评估遵循这一协议。
| 模型 | 参数量 | 平均 WER (%) | 平均 CER (%) |
|---|---|---|---|
| Falcon-ASR | 1.6B | 20.92 | 8.79 |
| Audar-ASR-V1-Turbo | 2.35B | 23.17 | 9.23 |
| Cohere Transcribe Arabic (07-2026) | 2.0B | 25.87 | 11.80 |
| omniASR LLM 7B | 7.0B | 28.32 | 12.52 |
WER 是词错率;CER 是字符错误率。数值越低表示性能越好。
我们在相同的六个测试集上评估了 Falcon-ASR,使用排行榜中固定的样本列表。竞争模型的数据是排行榜上发布的平均值,已于 2026 年 9 月 30 日核验。该模型的平均词错率比该版本中已发布的最佳结果低 2.25 个百分点。
تقييم اللهجة الإماراتية
评估阿联酋方言已有公开数据可用,Casablanca 数据集中就包含一个阿联酋专用的部分。我们通过内部评估补充了这一覆盖范围,使用专门制作的测试录音和经过人工审核的参考文本,对额外的阿联酋和海湾地区语音录音进行评估,以在公开的阿联酋数据之外进一步评估转录准确性。
在我们针对阿联酋的内部评估中,Falcon-ASR 的词错率为 22.73%,字符错误率为 10.19%:
| 模型 | 参数量 | WER (%) | CER (%) |
|---|---|---|---|
| Falcon-ASR | 1.6B | 22.73 | 10.19 |
| Qwen3-Omni-30B-A3B-Instruct | 30.0B (3.0B active) | 26.80 | 12.72 |
| Audar-ASR-V1-Turbo | 2.35B | 27.89 | 13.75 |
| Cohere Transcribe 阿拉伯语(07-2026) | 2.0B | 31.05 | 18.07 |
| Qwen3-ASR-1.7B-hf | 2.0B | 31.52 | 13.35 |
| Audar-ASR-V1-Flash | 0.78B | 32.87 | 15.36 |
在此对比的系统中,Falcon-ASR 录得了最低的词错误率和字符错误率。其词错误率比排名第二的 Qwen3-Omni 低了 4.07 个百分点。结果显示,在本次评测中,词级和字符级的转写准确率均有所提升。
التدريب على ظروف تسجيل مختلفة
ضمّنا بيانات التدريب ضوضاء خلفية وكلامًا متداخلًا وموسيقى وصدى الصوت وتأثيرات الاتصالات الهاتفية، إلى جانب تغيّرات في سرعة الكلام وحدّة الصوت. وطبّقنا المعالجة نفسها على التسجيلات الإماراتية، لتهيئة النموذج للتعامل مع ظروف مختلفة قد يواجهها في الاجتماعات والمكالمات والتسجيلات اليومية الأخرى.
الإنجليزية واللغات الأخرى
Falcon-ASR 使用相同的模型权重来转写英语语音。在用于 Hugging Face 开放语音识别排行榜的七个公开英语测试集上,我们的评测显示其平均词错误率为 5.74%。
| 测试集 | WER (%) |
|---|---|
| LibriSpeech clean | 1.75 |
| LibriSpeech other | 4.21 |
| SPGISpeech | 2.02 |
| VoxPopuli | 3.87 |
| GigaSpeech | 8.15 |
| AMI | 8.33 |
| Earnings-22 | 11.86 |
يدعم النموذج أيضًا الفرنسية والإسبانية والبرتغالية. وتستخدم اللغات الخمس أوزانًا واحدة، دون الحاجة إلى تحديد اللغة مسبقًا. ويكون الناتج تفريغًا نصيًا باللغة المنطوقة.
أساس النموذج
Falcon-ASR 建立在我们 Falcon3-Audio 工作的基础上。论文 Competitive Audio-Language Models with Data-Efficient Single-Stage Training on Public Data 介绍了 Falcon3-Audio 的架构和训练方法。
体验 Falcon ASR
我们在 Hugging Face 上的演示可让您体验 Falcon-ASR 并探索其语音转写能力。API 和原生应用程序的访问也已在计划之中。欢迎您使用自己的录音来试用该模型。
来源:Hugging Face Blog · huggingface.co