伊朗帕亚姆·努尔大学发布HPMD历史波斯手稿数据集 破解古文献AI研究数据短缺痛点
近年来,全球文化遗产数字化进程持续加速,历史手稿、古籍等珍稀文化资源的智能化识别、检索与保护成为学界和产业界的共同发力方向,但小语种古文字领域长期面临公开训练数据集稀缺、单词级标注成本过高的行业痛点,相关AI技术的落地应用受到明显制约。在此背景下,伊朗帕亚姆·努尔大学正式对外发布HPMD(Historical Persian Manuscript Dataset)历史波斯手稿数据集,为古波斯文献的智能化研究提供了首个规模化公开训练数据源。
本次发布的HPMD数据集专为单词定位任务设计,数据样本源自多本不同年代、流派的历史波斯诗歌与散文书籍,覆盖223页手稿、3678行文本、37631个单词和130630个字符,充分兼顾了不同字体、排版布局的样本多样性。为控制标注成本同时保障数据可用性,团队设计了差异化标注方案:由11名专业标注人员通过Transkribus平台完成区域、行和文本三级标注,未标注单词级边界,可支持仅需行级标注即可实现单词搜索的技术路径,直接解决了历史波斯手稿公开数据集缺失、单词级标注成本过高的两大行业核心问题。数据集同时附有完整的页面级属性标签,可满足不同研究场景的调用需求。
从应用价值来看,HPMD数据集首先可直接服务于历史手稿的单词定位研究,助力历史学家在浩如烟海的古文献中快速定位特定人名、地名、日期或事件关键词,大幅降低文献检索的时间成本。除此之外,该数据集还可支撑古波斯文OCR识别模型优化、古籍流派与年代自动鉴别、跨文献主题检索、数字化古籍库建设等多个方向的研究,也能为波斯文化的全球传播、濒危手写古籍的数字化留存提供数据支撑。本次数据集的发布不仅填补了细分领域的供给空白,其采用的低成本标注方案也为其他稀缺语种古文献数据集的构建提供了可复用的参考路径,对推动文化数据要素开放共享、助力全球文化遗产数字化保护具有典型借鉴意义。





_1769672084863.jpg)