北京市完成中文-老挝文AI平行语料数据集知识产权登记 赋能低资源语言技术与跨境数字服务

五号数据雷达数据知识产权登记6
2026年9月30日,数据堂(北京)科技股份有限公司旗下人工智能中文-老挝文平行语料数据集正式完成北京市数据知识产权登记,该数据集可为中老跨语言机器翻译、跨境信息服务等领域研发提供高质量训练数据支撑,也为低资源语言类数据要素的合规流通奠定了实践基础。

随着数据要素市场化建设持续推进,数据知识产权登记作为明确数据权属、规范数据流通、保障数据主体权益的核心前置环节,已成为国内优质数据资产进入公开流通市场的必备合规凭证。与此同时,随着中老两国经贸往来、人文交流的不断深化,尤其是中老铁路等跨境基础设施投入运营后,跨境电商、跨境政务、跨境文旅等场景对高质量中老跨语言智能服务的需求持续上涨,但老挝语作为典型低资源语言,公开领域可落地商用的高质量平行语料长期处于稀缺状态,直接制约了相关AI技术的研发与落地效率。

2026年9月30日,数据堂(北京)科技股份有限公司研发的人工智能中文-老挝文平行语料数据集正式完成北京市数据知识产权登记,标志着该数据集的权属关系、合规性、质量标准均获得官方认定,具备了市场化流通与商用授权的合规基础。

据了解,本次完成登记的中文-老挝文平行语料数据集,面向中文与老挝文平行语料的采集与标注场景打造,全部语料由成对的中文文本与对应的专业老挝文译文组成,配套唯一编号标识与精准双语对齐标注,可为相关人工智能模型提供高质量的中老平行训练与评测语料,适用于跨语言机器翻译、双语对齐与跨语言理解技术的研发与应用。

从应用价值来看,该数据集可用于中老双向神经机器翻译模型的训练、评测及优化,有效提升翻译系统对老挝文这一低资源语言的翻译质量与鲁棒性;也可用于跨语言信息检索、双语词典构建与语言学研究,支撑面向东南亚多语种智能翻译、跨境交流等产品的算法验证与效果调优。在实际落地场景中,该数据集可广泛支撑中老跨境电商智能客服、跨境政务服务自动翻译、跨境物流单据智能识别、文旅场景多语种导览等多类数字化产品的研发,降低相关企业的语料采集与标注成本,加快产品落地效率。

查看人工智能中文-老挝文平行语料数据集

登记内容:

本次登记的完成,不仅为中老跨语言技术研发领域提供了合规可用的优质数据资产,也为国内低资源语言类数据要素的确权登记、市场化流通提供了可参考的实践样本,对于助力面向RCEP区域的数字服务能力建设、支撑数字丝绸之路的数字化交流服务体系打造均具有积极意义。

数据合作广告位
二维码
社区交流群

面向社区/商业的数据集话题

二维码
科研交流群

面向高校/科研机构的开源数据集话题

二维码
关注我们