北京完成人工智能泰语全双工自然说话语音数据集知识产权登记 支撑东南亚智能语音产业创新

五号数据雷达数据知识产权登记3
2026年9月30日,数据堂(北京)科技股份有限公司旗下人工智能泰语全双工自然说话语音数据集正式完成北京市数据知识产权登记,该数据集还原真实泰语对话场景特征,可为泰语语音识别模型训练、算法优化及东南亚市场智能语音产品研发提供高质量数据支撑。

当前我国数据要素市场化建设正进入确权、流通的关键落地阶段,北京市作为全国数据知识产权制度改革先行试点地区,其推出的数据知识产权登记服务可对合法合规采集加工的数据资源的权属、加工过程、应用范围等进行官方存证,为数据资产的交易、质押、维权等全生命周期管理提供合规依据。随着东南亚数字经济规模近5年保持15%以上的年均增速,泰语作为覆盖泰国、老挝等国家超1亿使用人口的核心区域语言,面向泰语场景的智能语音交互需求在跨境电商、车载娱乐、本地生活、公共服务等领域持续爆发,但适配真实对话场景的高质量泰语语音训练数据供给长期不足,成为制约泰语智能语音技术迭代与落地的核心痛点之一。

数据堂(北京)科技股份有限公司本次登记的人工智能泰语全双工自然说话语音数据集,主要应用于人工智能语音识别领域,为泰语语音识别声学模型与语言模型的训练、优化及算法研究提供高质量的自然说话语音数据支撑。该数据集以全双工自然说话模式采集泰语语音样本,真实还原了日常交流中的口语化表达特征与对话交互场景,能够有效支撑语音识别模型对泰语在真实对话场景下的声学特征与语言规律进行深度学习与建模,帮助模型精准捕捉泰语在音素层面、声调层面及韵律层面的独特声学规律,显著提升语音转写的准确率与鲁棒性。同时,该数据集还可用于泰语语音识别算法的研究与评测,支持声学模型与语言模型的联合优化,广泛服务于泰语智能语音助手、语音输入法、智能客服、车载语音系统及面向东南亚语言市场的智能语音产品开发等应用场景,尤其可为中资企业出海东南亚的跨境电商实时语音翻译、境外旅游服务语音交互、本地生活平台语音咨询等垂直场景提供数据支撑,降低企业泰语语音产品的研发门槛,缩短技术落地周期,助力推动泰语智能语音识别技术的持续迭代与普及应用。本次完成官方知识产权登记后,该数据集的权属得到官方认定,后续可通过合规渠道进入数据要素市场流通,在保障数据供给方合法权益的同时,为更多研发主体提供可信任的优质训练数据源,进一步激活东南亚区域智能语音赛道的创新活力。

查看人工智能泰语全双工自然说话语音数据集

登记内容:

数据合作广告位
二维码
社区交流群

面向社区/商业的数据集话题

二维码
科研交流群

面向高校/科研机构的开源数据集话题

二维码
关注我们