北京市完成人工智能中日平行语料数据集知识产权登记 赋能跨语言智能场景落地

五号数据雷达数据知识产权登记3
2026年9月30日,数据堂(北京)科技股份有限公司旗下人工智能中文-日文平行语料数据集正式完成北京市数据知识产权登记,该数据集将为中日神经机器翻译模型研发、双语语料体系建设提供高质量数据支撑,进一步推动跨境交流场景的智能化升级。

当前我国数据要素市场建设进入快车道,数据知识产权登记作为数据确权、权益保障、流通交易的核心前置环节,正在成为AI训练数据、行业数据等各类数据资源合规入市的标配。北京市作为全国数字经济标杆城市,也是国内最早探索数据知识产权登记制度的地区之一,其出具的登记证明具备权益公示、合规佐证等多重效力,为数据要素的市场化流转提供了重要的制度支撑。2026年9月30日,数据堂(北京)科技股份有限公司旗下人工智能中文-日文平行语料数据集正式完成北京市数据知识产权登记,成为国内AI多语言训练数据领域又一获得官方权属认定的标准化数据集产品。

据了解,本次登记的人工智能中文-日文平行语料数据集,核心定位为中日跨语言AI技术研发的基础训练资源,主要应用于人工智能机器翻译领域,为中文-日文神经机器翻译(NMT)模型的训练、优化与迭代提供高质量的平行双语对齐文本支撑。该数据集通过提供经过清洗与规范化处理的中文-日文互译语料,能够帮助翻译模型有效学习两种语言在词汇映射、句法结构及语义表达层面的对应规律与转换规则,显著提升中日双向翻译的准确性、流畅度与专业术语处理能力。同时,该数据集可用于机器翻译技术效果的持续优化与评测,支持构建和完善中日双语翻译数据库。

从应用价值来看,该合规确权后的数据集可广泛服务于多个实体场景:在中日跨境商务领域,可支撑外贸企业智能客服、合同翻译、商务沟通工具的研发,降低跨境贸易的沟通成本;在政务公共服务领域,可为涉外服务窗口、出入境服务系统提供翻译能力支撑,提升对日籍在华人员的服务效率;在教育文化领域,可用于日语学习辅助工具、中日文化交流内容的智能翻译开发,助力文化传播;在旅游出行领域,可支撑实时翻译设备、景区导览系统的多语言能力升级,提升跨境游客的出行体验;同时也可为跨语言信息检索、多模态大模型多语言能力训练等前沿AI研发场景提供高质量数据源,助力提升中文与日文互译的智能化水平与效率,推动面向东北亚语言市场的智能翻译技术普及与应用。

本次登记也为AI训练数据类产品的知识产权保护提供了实践参考:完成官方登记后,该数据集的权属清晰性、合规性得到官方认定,后续可通过数据要素市场开展合规授权、交易流通,既能够保护数据生产方的研发投入权益,也能够降低下游应用企业的数据源合规风险,对完善AI数据资产价值体系、推动数据要素产业规范化发展具有积极意义。

查看人工智能中文-日文平行语料数据集

登记内容:

数据合作广告位
二维码
社区交流群

面向社区/商业的数据集话题

二维码
科研交流群

面向高校/科研机构的开源数据集话题

二维码
关注我们