北京市完成泰语全双工自然说话语音数据集知识产权登记 为东南亚语音AI研发提供合规支撑

五号数据雷达数据知识产权登记2
2026年9月30日,数据堂(北京)科技股份有限公司旗下人工智能泰语全双工自然说话语音数据集完成北京市数据知识产权登记,该数据集可为泰语语音识别、自然对话AI等技术研发提供高质量数据底座,赋能面向东南亚市场的智能语音产品迭代落地。

当前我国数据要素市场化配置改革正进入落地深化阶段,数据知识产权登记作为保障数据要素合法流通、明确数据权属、维护数据开发方合法权益的核心制度环节,已在全国多个数字经济试点城市落地推广。北京市作为全国数字经济标杆城市,此前已率先构建起覆盖数据登记、存证、流通全链条的服务体系,完成登记的数据产品可获得官方出具的权属证明,在数据交易、权益质押、侵权维权等场景具备法定参考效力,是数据资源转化为可流通数据资产的核心凭证。

近年来随着RCEP框架下跨境数字经济合作持续升温,东盟已成为国内智能科技企业出海的核心赛道,泰语作为覆盖超1亿人口的东盟核心通用语言,对应的智能语音交互需求覆盖消费电子、跨境商贸、公共服务、出行服务、在线教育等多个领域,但长期以来,高质量、合规化的泰语交互类训练数据供给缺口较大:多数公开泰语语音数据集仅覆盖单人口述、标准发音场景,缺乏真实对话场景下的全双工交互数据,普遍存在口语化特征不足、交互逻辑失真等问题,导致训练出的语音识别模型在面对插话、口音变异、口语化省略表达等真实场景时准确率大幅下降,制约了相关产品的落地体验。

2026年9月30日,数据堂(北京)科技股份有限公司旗下人工智能泰语全双工自然说话语音数据集正式完成北京市数据知识产权登记,为泰语智能语音研发领域提供了合规可用的高质量数据供给。该数据集采用全双工自然说话模式采集泰语语音样本,真实还原了日常交流中的口语化表达特征与对话交互场景,能够有效支撑语音识别模型对泰语在真实对话场景下的声学特征与语言规律进行深度学习与建模,帮助模型精准捕捉泰语在音素层面、声调层面及韵律层面的独特声学规律,显著提升语音转写的准确率与鲁棒性。

该数据集主要应用于人工智能语音识别领域,可为泰语语音识别声学模型与语言模型的训练、优化及算法研究提供高质量的自然说话语音数据支撑,同时还可用于泰语语音识别算法的研究与评测,支持声学模型与语言模型的联合优化,典型应用场景覆盖泰语智能语音助手、语音输入法、智能客服、车载语音系统、跨境电商智能语音接待、泰语口语在线评测、多语言实时翻译设备等面向东南亚语言市场的智能语音产品开发,助力推动泰语智能语音识别技术的持续迭代与普及应用。本次登记完成后,该数据集的权属得到官方认可,后续可通过合规渠道面向各类AI研发机构、科技企业开放授权,既降低了数据需求方的权属风险,也为小语种训练数据的合规化流通提供了可参考的实践样本,对完善我国多语种AI数据供给体系、支撑企业面向东盟市场的AI产品落地具有积极意义。

查看人工智能泰语全双工自然说话语音数据集

登记内容:

数据合作广告位
二维码
社区交流群

面向社区/商业的数据集话题

二维码
科研交流群

面向高校/科研机构的开源数据集话题

二维码
关注我们