人工智能中文-蒙古文平行语料数据集完成北京数据知识产权登记 覆盖多类跨语言AI应用场景

五号数据雷达数据知识产权登记4
2026年9月30日,数据堂(北京)科技股份有限公司研发的人工智能中文-蒙古文平行语料文本数据集正式完成北京市数据知识产权登记,该数据集将为中蒙机器翻译、跨语言信息处理、多语种大模型训练等领域提供合规可溯源的高质量数据支撑,助力中蒙跨领域数字化交流。

随着数字经济深化发展与中蒙经贸、文化、科技等领域交流频次提升,跨语言信息处理能力已经成为支撑跨境合作、民族文化传播、边境公共服务供给的核心数字化底座。作为人工智能跨语言应用的核心生产资料,高质量小语种平行语料的供给不足、权属不清一直是行业发展的核心痛点,而数据知识产权登记正是明确数据权属、保障数据要素合规流通的关键制度安排——北京市作为全国数据要素市场化配置改革的先行试点,其数据知识产权登记体系已经成为国内数据资产确权、合规流通的重要参照标准。

数据堂(北京)科技股份有限公司本次完成登记的人工智能中文-蒙古文平行语料文本数据集,是少数民族语言数据要素合规化进程中的重要落地成果,本数据集可面向多类应用场景提供中文与蒙古文互译的能力支撑:
1)机器翻译模型训练:作为高质量的句级中文-蒙古文平行语料,支撑统计机器翻译与神经网络机器翻译模型的训练、微调与评测,提升中蒙双向翻译在医疗、新闻、科技、旅游、跨境电商、边境公共服务等专业领域的术语规范性,降低专业场景翻译误差;
2)翻译数据库建设:为翻译记忆库、术语库与双语知识库的构建提供结构化的平行句对,支撑本地化服务、官方文档翻译与跨语言检索等产品的底层数据积累,降低中蒙跨语言服务研发企业的前期数据成本;
3)跨语言信息检索与内容理解:为面向蒙古语市场的搜索引擎、新闻聚合与舆情分析系统提供中蒙双语对齐语料,增强对蒙古文内容的语义理解与跨语言匹配能力,助力出海企业精准洞察蒙古语市场用户需求;
4)多语种大模型训练:作为非英语小语种的高质量平行语料,为翻译大模型与多语种对话模型提供中文-蒙古文方向的预训练与对齐数据,增强模型在小语种上的泛化能力与翻译鲁棒性,改善当前通用大模型小语种翻译准确率偏低的行业痛点。

此次完成数据知识产权登记后,该数据集拥有了明确的权属证明,后续可通过合规渠道进入数据要素市场流通,为相关主体使用语料数据规避了版权风险,也为其他少数民族语言类数据资产的确权、流通提供了可参考的实践样本。

查看人工智能中文-蒙古文平行语料文本数据集

登记内容:

数据合作广告位
二维码
社区交流群

面向社区/商业的数据集话题

二维码
科研交流群

面向高校/科研机构的开源数据集话题

二维码
关注我们