天津大学发布全球首个斯里兰卡文化价值观对齐数据集LKValues 破解低资源语言大模型文化适配痛点
随着大语言模型全球化应用进程加速,主流模型训练语料集中于高资源语言的特征,导致其在面向低资源语言地区落地时,普遍存在文化适配不足、价值观偏差甚至文化冒犯等问题,成为制约AI普惠化、跨区域落地的核心痛点之一。尤其是针对南亚、东南亚等小语种集中区域的定制化对齐数据资源,目前仍处于高度稀缺状态,也成为数字丝绸之路建设中AI服务出海需要攻克的关键难点。
2026年7月23日,天津大学联合相关机构在预印本平台arXiv正式发布LKValues数据集,这也是全球首个针对斯里兰卡社会价值观对齐的专业资源套件,核心定位就是填补这一领域的空白,破解大模型在多元文化社会中的文化偏见难题。
据介绍,本次发布的LKValues数据集共包含约15万条僧伽罗语-英语双语场景化指令实例,语料基础来源于2009年至2023年的公开斯里兰卡新闻语料,标注规则则基于对205名斯里兰卡本地受访者开展的三语调查,从中提炼出40项获得当地社会多数认可的核心社会价值观作为标注依据。整个数据集的构建过程既融合了国际通用的社会价值研究框架,也引入了本地化大模型辅助启发机制,所有场景提取、标注结果都经过多轮人工引导验证,保障了数据的文化准确性、场景实用性与标注质量。
作为面向低资源语言、特定国家文化场景打造的垂直数据集,LKValues的核心应用方向集中在两大领域:一是大模型的文化价值观对齐研究,为学界、产业界探索不同文化语境下的AI伦理对齐、偏见治理提供标准化的测试与训练基准;二是低资源语言模型的微调优化,支持面向斯里兰卡本土场景的大模型训练,助力模型生成符合当地文化认知、社会习俗的内容。
从应用场景来看,该数据集未来可广泛支撑多类本地化AI产品的研发:面向斯里兰卡的政务服务智能助手,可依托该数据集实现内容校准,避免输出违背当地社会公序良俗的回复;跨境电商、跨境服务的智能客服系统,可通过微调提升与当地用户沟通的文化适配性,降低文化冲突风险;面向本地的教育、医疗公共服务AI工具,也可基于该数据集优化输出逻辑,更好匹配当地用户的认知习惯。此外,该数据集也为全球跨文化AI研究、低资源语言数字化资源建设提供了可参考的实践范式,对推动数据要素领域的垂直细分资源建设、支撑AI技术的普惠性落地具有典型示范意义。





_1769672084863.jpg)