上海交大联合团队发布《红楼梦》中日双语文化负载语料数据集 填补跨文化机器翻译评测基准空白
随着大语言模型技术的快速迭代,机器翻译的通用场景准确率已提升至较高水平,但涉及历史典故、民俗传统、宗教文化等带有独特文化属性的内容翻译,始终是AI翻译的核心瓶颈——尤其在中日文化交流场景中,两国文化既存在同源性又有差异化发展路径,文化负载表达的误译、漏译会直接影响跨文化传播效果与信息传递准确性,行业长期缺乏高标注质量、覆盖文化维度全面的细分领域基准数据集。近日,上海交通大学联合华东理工大学研究团队正式发布Dream of the Red Chamber corpus数据集,相关成果于2026年7月22日首发于学术预印本平台arXiv,为破解上述行业痛点提供了新的基础工具支撑。
该数据集以中国古典文化巅峰代表作《红楼梦》为核心语料来源,选用日本汉学家伊藤漱平翻译的权威中日双语版本为基础,共筛选收录500个经过多轮校验的文化负载片段,均匀覆盖生态、宗教、物质、语言和社会五大文化类别,其中源文本平均长度约24词,目标文本平均长度约51词。为保障分类准确性与数据平衡性,项目团队共组织4名中文研究生完成初步标注,4名日语研究生开展二次筛选核验,全程耗时20天完成全部数据分类与平衡性处理工作。
从应用价值来看,该数据集首先可作为跨文化机器翻译性能的权威评估基准,解决过往文化类翻译效果缺乏统一量化判断标准的问题;其次可用于大语言模型的微调训练,帮助AI系统更精准地理解中国古典文化语境下的特殊表达,减少文化误译;此外,该数据集也可为古典文学数字化出海、中日跨文化交流智能工具开发等场景提供底层语料支撑。作为国内为数不多的聚焦古典文化跨语言场景的高质量标注数据集,本次发布的《红楼梦》语料数据集既填补了中日文化翻译细分领域的基准空白,也为文化类数据资产的价值挖掘、数据要素在文化数字化领域的落地应用提供了参考样本,对推动机器翻译从“语义准确”向“文化适配”升级、助力中国文化数字化对外传播具有重要的行业意义。
查看Dream of the Red Chamber corpus





_1769672084863.jpg)