布加勒斯特大学发布全球首个罗马尼亚语词汇简化数据集RALS 填补低资源NLP领域资源空白

五号数据雷达开源数据市场3
布加勒斯特大学研究团队于2026年7月22日在arXiv平台首发RALS(罗马尼亚语自动词汇简化)数据集,作为全球首个针对罗马尼亚语构建的综合性词汇简化专项数据集,其将填补该语种词汇复杂性研究与应用的资源缺口,为低资源语言自然语言处理发展及公共信息包容性建设提供支撑。

当前全球自然语言处理(NLP)技术研发与应用多集中于英语、汉语等高资源语种,使用人口规模相对有限的小语种普遍面临标注数据资源匮乏的困境,词汇简化作为提升文本可读性、消除信息获取壁垒的核心NLP任务,其相关数据集的缺失更是直接制约了低资源语种的信息普惠服务落地。近日,布加勒斯特大学研究团队正式发布RALS(Romanian Automatic Lexical Simplification,罗马尼亚语自动词汇简化)数据集,该数据集于2026年7月22日首发于学术预印本平台arXiv,是全球首个针对罗马尼亚语构建的综合性词汇简化专项数据集,旨在填补该语言在词汇复杂性预测与自动简化任务中的长期资源空白。

据公开信息显示,RALS数据集共包含3,921个词汇-句子对样本,涵盖人工翻译、词汇级翻译及全新采样三类子集,数据来源覆盖维基百科词条、科普文章、文学作品、公共机构文档等多元文本类型,可覆盖不同场景下的词汇复杂性特征。为保障数据质量,研究团队在构建过程中融合了多步骤人工翻译、机器辅助校验、众包标注等多元方法,通过严格的配对排序与复杂性评分机制完成全流程质量管控,数据集标注精度满足学术研究与产业落地的双重需求。

据介绍,该数据集主要应用于自然语言处理领域的词汇简化与复杂性预测研究,尤其可为低资源语言的NLP技术研发提供基准训练数据。从落地场景来看,基于该数据集训练的词汇简化模型,可在教育领域辅助开发面向低龄学习者、读写障碍群体的自适应阅读工具,将复杂文本自动转化为适配不同认知水平的表达;在医疗场景中可实现专业医学文档、诊疗告知内容的通俗化转换,降低医患信息差;在公共服务领域可支撑政务公告、应急通知等公共文本的简化改造,覆盖更多语言能力、文化程度不一的群体,切实提升社会信息包容性。

从行业维度来看,多语种标注数据集是NLP产业发展的核心基础要素,当前低资源语种的数据资源缺口已成为制约全球多语种AI技术普惠落地的核心瓶颈。本次RALS数据集的发布,不仅为罗马尼亚语的AI应用生态建设提供了关键的基础数据支撑,其构建过程中采用的多源数据整合、多元标注结合的方法论,也为其他小语种的同类数据集建设提供了可参考的实践范式,对全球多语种数字资源体系建设、数据要素资源的均衡化发展具有积极的借鉴价值。

查看RALS (Romanian Automatic Lexical Simplification)

详情页内容:

数据合作广告位
二维码
社区交流群

面向社区/商业的数据集话题

二维码
科研交流群

面向高校/科研机构的开源数据集话题

二维码
关注我们