北京:人工智能中文-乌尔都文平行语料数据集完成数据知识产权登记 赋能跨境跨语言AI服务

五号数据雷达数据知识产权登记5
2026年9月30日,数据堂(北京)科技股份有限公司旗下人工智能中文-乌尔都文平行语料数据集正式完成北京市数据知识产权登记,该合规标注的高质量跨语言语料资源,将为中乌双语机器翻译、跨境交流数字化等领域的技术研发与落地提供核心数据支撑。

当前,数字经济与跨境合作深度融合,跨语言智能服务已经成为支撑双边经贸、文化、政务交流的核心数字化基础设施。作为全国首批数据知识产权登记试点地区,北京推出的数据知识产权登记制度,是明确数据资产权属、规范数据流通、保护数据研发方合法权益的重要制度创新,为优质数据资源进入要素市场、释放商业价值提供了合规基础。乌尔都语作为巴基斯坦官方语言,全球使用人口超2亿,是南亚地区重要的通用语种之一,随着中巴经济走廊等合作机制的持续深化,双边各领域对高质量中乌跨语言智能服务的需求持续攀升,而经过规范标注的平行语料数据集,正是相关AI技术研发不可或缺的核心基础资源。

2026年9月30日,数据堂(北京)科技股份有限公司研发的人工智能中文-乌尔都文平行语料数据集正式完成北京市数据知识产权登记。据介绍,本数据集面向中文与乌尔都文平行语料的采集与标注场景构建,所有语料均由成对的中文文本与对应的乌尔都文译文组成,配套统一编号标识与专业双语对齐标注,完全符合人工智能模型训练与评测的标准化要求,可为相关技术研发提供规范的高质量语料支撑。

从应用价值来看,该数据集适用于跨语言机器翻译、双语对齐与跨语言理解技术的全流程研发与落地:一方面可直接用于中文与乌尔都文双向神经机器翻译模型的训练、评测及优化,有效提升翻译系统对中文与乌尔都文自然文本的翻译准确率与鲁棒性,降低跨语言沟通的技术门槛;另一方面也可支撑跨语言信息检索、双语词典构建与语言学研究等工作,为多语种智能翻译、跨境交流相关产品的算法验证与效果调优提供数据基础。除技术研发场景外,该数据集后续可广泛适配于跨境电商平台智能客服翻译、中巴双边文旅内容本地化适配、跨境政务服务多语种响应、外贸单据自动翻译处理等多个落地场景,为双边各领域的数字化合作提供支撑。本次数据知识产权登记完成后,该数据集的资产属性获得官方确权,既为后续合规进入数据要素市场流通扫清了权属障碍,也为研发方的知识产权保护提供了官方依据,将进一步激发市场主体生产高质量多语种语料资源的积极性,助力我国面向南亚的数字化服务能力建设,支撑数字丝绸之路相关布局落地。

查看人工智能中文-乌尔都文平行语料数据集

登记内容:

数据合作广告位
二维码
社区交流群

面向社区/商业的数据集话题

二维码
科研交流群

面向高校/科研机构的开源数据集话题

二维码
关注我们