中文-哈萨克文平行语料数据集完成北京市数据知识产权登记 为中哈跨境数字场景提供合规数据支撑
随着“数字丝绸之路”建设不断深化,中国与哈萨克斯坦作为共建“一带一路”的重要合作伙伴,双方在跨境电商、文化旅游、科技合作、公共服务等领域的交流需求持续增长,跨语言智能翻译作为打通跨境沟通壁垒的核心数字化工具,长期面临高质量、多领域双语平行训练语料供给不足、权属不清晰的行业痛点。作为全国数据要素市场化配置改革的先行试点,北京市搭建的数据知识产权登记体系,是明确数据权属、保障数据要素合规流通、激励数据资源创新开发的核心制度安排,为人工智能训练数据等细分数据品类的合规化开发与流通提供了制度基础。
2026年9月30日,数据堂(北京)科技股份有限公司旗下人工智能中文-哈萨克文平行语料文本数据集正式完成北京市数据知识产权登记。本数据集面向中文与哈萨克文(西里尔文)平行语料的采集与标注场景,内容覆盖科技、医疗、旅游、新闻及口语等多个领域,由成对的中文文本与对应的哈萨克文译文组成,配套编号标识与双语对齐标注,可为相关人工智能模型提供高质量的中哈平行训练与评测语料,适用于跨语言机器翻译、双语对齐与跨语言理解技术的研发与应用。
从应用场景来看,该数据集可用于中哈双向神经机器翻译模型的训练、评测及优化,提升翻译系统对哈萨克文这一哈萨克斯坦主要官方语言的翻译质量与鲁棒性,降低跨境电商智能客服、涉外政务服务、国际会议智能同传等场景的专业内容翻译误差;可用于跨语言信息检索、双语词典构建与语言学研究,为面向中亚地区的数字内容传播、区域舆情监测、学术交流研究等领域提供算法基础;还可支撑面向中哈跨境交流、多语种智能翻译等产品的算法验证与效果调优,大幅降低相关人工智能应用的研发门槛。
本次登记也为国内多语种AI训练数据的合规化运营提供了参考样本:通过数据知识产权登记明确权属后,该数据集后续的流通交易、授权使用等商业活动将具备更清晰的权益基础,既能够保障数据开发方的创新收益,也能为下游应用企业提供合规可靠的高质量数据来源,对完善跨境交流领域的数据要素供给体系、服务数字丝绸之路建设具有积极的行业示范意义。





_1769672084863.jpg)