数据堂中泰平行语料数据集完成北京数据知识产权登记 覆盖多类跨境NLP应用场景
随着RCEP区域数字经济协作持续深化,中泰双边跨境电商、文旅交流、数字服务贸易等领域的互动规模逐年攀升,中泰双语自然语言处理(NLP)技术的市场需求持续释放。作为低资源语种,泰文NLP技术落地长期面临高质量标注语料短缺、数据权属不清晰、流通合规性不足等共性痛点,而北京市率先落地的数据知识产权登记机制,正是为数据要素确权、合规流通、权益保障提供的核心制度支撑,可有效明确数据资源的知识产权归属,为后续数据的商业化应用、交易流通扫清合规障碍。
2026年9月30日,数据堂(北京)科技股份有限公司旗下人工智能中文-泰文平行语料数据集正式完成北京市数据知识产权登记。该数据集收录了海量中文句子及其对应的标准泰文译文,属于高质量标注的稀缺小语种平行语料资源,可面向多类应用场景提供中泰双语平行语料层面的基础支撑: 1)机器翻译系统构建:为中文-泰文神经机器翻译模型的训练与评测提供高质量平行句对,支撑编码器-解码器与大规模多语预训练模型在中泰方向的对齐学习,提升翻译系统对双语句法的覆盖能力,可广泛应用于跨境电商商品翻译、跨境政务服务、文旅智能导览等场景; 2)跨语言检索与信息抽取:为面向泰文互联网内容的跨语言检索、关键词对齐与实体抽取提供中泰对照语料,支撑跨境电商内容本地化、双边舆情监测、出海内容的自动分类与聚合,降低中泰跨境信息交互的语言门槛; 3)双语教学与辅助阅读:为泰语学习者与中文母语者的双向语言学习应用提供标准对照例句,支撑智能教辅平台的例句推送、译文评测与错误诊断功能,改善双向语言学习效率,服务于留学生教育、跨境从业人员语言培训等需求; 4)泰文自然语言处理基础能力建设:为泰文分词、词性标注与句法分析等上游任务提供中文侧语义锚点,支撑低资源泰文方向的自然语言处理模型训练与迁移学习,降低泰文NLP技术的研发成本与落地周期。
登记内容:
业内人士指出,本次中泰平行语料数据集完成数据知识产权登记,不仅为该数据集后续的商业化授权、流通交易提供了合规权属证明,也为国内小语种语料类数据资产的确权、流通提供了可参考的实践样本,对完善数据要素市场的细分品类供给、支撑RCEP区域跨境数字协作有着积极意义。





_1769672084863.jpg)