北京:数据堂英韩平行语料数据集完成数据知识产权登记 赋能多语言AI场景落地

五号数据雷达数据知识产权登记3
2026年9月30日,数据堂(北京)科技股份有限公司旗下人工智能英文-韩文平行语料数据集正式完成北京市数据知识产权登记,该数据集覆盖多领域双语对照内容,可为机器翻译、跨语言检索等多类AI场景提供标准化基础数据支撑,助力多语言AI技术研发与商业化落地。

当前,随着跨境经贸往来、国际文化交流、全球数字化服务需求持续攀升,多语言AI技术已成为支撑跨境场景数字化的核心能力,而高质量、合规化的平行语料数据集,是训练机器翻译模型、跨语言语义系统的核心生产资料,直接决定了多语言AI产品的效果上限。作为全国数据要素市场化配置改革的先行试点,北京市推出的数据知识产权登记制度,可为合规数据产品提供官方权益背书,明确数据持有方的合法知识产权,同时为数据产品后续的流通交易、开放共享提供合规基础,是国内数据要素市场规范化建设的重要探索方向。

2026年9月30日,数据堂(北京)科技股份有限公司旗下人工智能英文-韩文平行语料数据集正式完成北京市数据知识产权登记。据了解,本次登记的数据集收录了海量英文句子及其对应的专业韩文译文,语料内容覆盖口语、旅游、新闻、金融等多个高频应用领域,可为多类英韩双语相关的AI技术研发、应用落地提供标准化的平行语料支撑:
1)机器翻译系统构建:为英文-韩文神经机器翻译模型的训练与评测提供高质量平行句对,支撑编码器-解码器架构与注意力机制的参数学习,有效改善译文的语义完整性与表达流畅度;
2)跨语言检索与语义匹配:支撑跨语言信息检索、双语文本匹配与语义向量建模,可用于构建面向英韩双语的内容检索、召回与排序能力,服务跨境内容平台、资讯平台的多语言服务需求;
3)多语言预训练与迁移学习:为多语言预训练语言模型提供精准的英韩对齐语料,支撑跨语言迁移学习、词表构建与句向量表示学习,降低大语言模型面向韩语场景的适配成本;
4)垂直场景翻译应用:基于覆盖多领域的语料内容,可服务于跨境电商对话翻译、入境游客出行翻译、中韩财经资讯自动翻译等垂直应用方向的模型训练与效果调优;
5)翻译质量评测与学术研究:为机器翻译译文质量评测、中韩语言学对比研究、翻译技术相关学术研究提供标准化的双语对照数据支撑,降低科研机构与高校的相关研究数据获取门槛。

查看人工智能英文-韩文平行语料数据集

登记内容:

行业分析人士指出,本次英韩平行语料数据集完成官方数据知识产权登记,一方面明确了数据持有方的合法权益,为该数据集后续面向AI企业、科研机构、跨境服务企业开放流通、交易合作扫清了合规障碍;另一方面也为国内多语言语料类数据产品的知识产权确权、合规入市提供了可参考的实践样本,对推动国内多语言AI产业规范化发展、支撑中韩跨境场景数字化建设具有积极意义。

数据合作广告位
二维码
社区交流群

面向社区/商业的数据集话题

二维码
科研交流群

面向高校/科研机构的开源数据集话题

二维码
关注我们