北京市数据知识产权登记再添落地成果:AI中-日文平行语料数据集完成确权 赋能多领域跨语言智能应用
当前我国数据要素市场化配置改革进入深水期,数据知识产权登记作为明确数据权属、保障数据主体合法权益、推动数据合规流通交易的核心基础性环节,已成为各地数据要素市场建设的重点布局方向。北京市作为全国首批数据知识产权工作试点城市,近年来持续优化登记服务流程、完善确权规则体系,为不同领域的合规数据资产提供规范化的确权路径,本次人工智能中文-日文平行语料数据集的完成登记,是北京市在语言类AI训练数据资产确权领域的最新落地成果。
2026年9月30日,国内头部AI训练数据服务商数据堂(北京)科技股份有限公司旗下的人工智能中文-日文平行语料数据集,正式完成北京市数据知识产权登记。据介绍,本次登记的数据集为经过多轮清洗、语义对齐、规范化校验的高质量中-日互译平行语料,核心应用于人工智能机器翻译领域,可为中文-日文神经机器翻译(NMT)模型的训练、优化与迭代提供标准化的双语对齐文本支撑。
不同于普通非结构化的网络爬取语料,该数据集经过专业语言学家审核、歧义内容标注、噪声信息过滤,能够帮助翻译模型精准捕捉两种语言在词汇映射、句法结构、语境语义及专业术语表达层面的对应规律,有效降低模型训练阶段的噪声干扰,显著提升中日双向翻译的准确性、语境适配性与专业领域术语处理能力。除了模型训练外,该数据集还可作为基准语料库用于机器翻译技术的效果评测、迭代优化,支撑行业级中日双语翻译数据库的构建与完善。
从落地应用场景来看,该类标准化平行语料数据集可广泛服务于多个领域的跨语言智能化升级:在中日跨境商务场景中,可支撑跨境电商平台的商品详情自动翻译、跨境商务谈判的实时同传工具优化;在政务公共服务领域,可为对日服务窗口的智能翻译终端、外籍人士办事指南多语言转换系统提供数据支撑;在文化教育与旅游领域,可用于对日中文学习产品的内容开发、文旅景区多语言导览系统的迭代、中日学术文献的跨语言检索工具优化等,全方位提升中日跨语言交互的智能化水平与效率,推动面向东北亚语言市场的智能翻译技术落地普及。
此次中-日文平行语料数据集完成数据知识产权登记,也为国内语言类数据资产的确权、流通提供了可参考的实践样本。随着跨语言交互需求的持续攀升,合规确权的多语种语料数据将进一步降低AI翻译产品的研发门槛,为我国数字经济的国际化拓展、东北亚区域数字经济合作提供数据要素层面的支撑。





_1769672084863.jpg)