不列颠哥伦比亚大学发布CARDAMOM数据集 覆盖21种阿拉伯语微方言填补语音识别场景空白
随着全球语音交互产业的快速扩张,多语言、多方言场景的语音识别准确率已经成为AI产品本地化落地的核心瓶颈。作为全球使用人口超4亿、覆盖20余个主权国家的通用语言,阿拉伯语的方言分化问题尤为突出——不同国家、不同区域的微方言发音、表达差异极大,甚至存在跨区域使用者无法直接沟通的情况,而传统语音识别数据集普遍采用“埃及阿拉伯语”“海湾阿拉伯语”等粗粒度分类标签,无法捕捉本地化的语音变异,也难以适配日常对话中普遍存在的语码转换(多种方言/语言混合使用)场景,成为阿拉伯语区域语音交互产品落地的核心障碍。
2026年9月28日,加拿大不列颠哥伦比亚大学联合多国高校研究团队在预印本平台arXiv正式发布CARDAMOM阿拉伯语微方言语音数据集,为上述行业痛点的解决提供了核心数据支撑。
据公开信息,CARDAMOM是全球为数不多覆盖多区域阿拉伯语微方言的开源语音数据集,由多国研究人员联合打造,共收录约40小时的转录语音数据,覆盖埃及、约旦、黎巴嫩、毛里塔尼亚、巴勒斯坦、沙特阿拉伯6个阿拉伯国家的21种微方言,包含27420条自然话语样本。为了最大化还原真实对话场景,所有数据均来自YouTube平台的非脚本化自然对话内容,由各区域母语使用者完成人工标注,除了基础的语音转写文本外,还同步提供了微方言分类标签、语码转换标注信息以及感知性别标签,数据集维度丰富度远超同类型粗粒度语音数据集。
根据项目团队公开的研发目标,CARDAMOM数据集主要用于支撑自动语音识别(ASR)系统的细粒度评估与适配优化,解决传统粗粒度方言标签无法捕捉本地化语音变异的行业痛点。从应用场景来看,该数据集可用于阿拉伯语区域本地化语音助手、智能客服系统的方言适配训练,显著提升下沉市场语音交互产品的识别准确率;其附带的语码转换标注,可支撑混合语言场景的语音识别模型研发,适配跨境电商、跨境社交、出入境服务等场景的语音转写需求;此外,该数据集也可为阿拉伯语社会语言学研究、区域方言保护等工作提供数据支撑。
当前全球数据要素市场中,多语言、低资源语言的公开数据集供给始终存在明显缺口,CARDAMOM的发布不仅填补了阿拉伯语微方言语音数据集的供给空白,也为其他小语种、方言类语音数据集的标注、构建提供了可参考的范式,对推动全球多语言AI技术落地、缩小不同语言区域的数字鸿沟具有重要意义。





_1769672084863.jpg)