大规模波斯语OCR数据集Persian Pixel首发arXiv 填补复杂低资源文字识别数据空白
在全球多语言AI技术快速迭代的当下,低资源语言的标注数据缺口已成为制约多语言大模型能力覆盖、非通用语数字化转型的核心瓶颈。尤其是波斯语这类拥有复杂书写系统的语言,受连笔变体多、变音符号规则复杂、公开标注数据集数量少质量参差不齐等问题限制,其OCR(光学字符识别)、文档理解相关技术的商业化落地进度长期落后于中英等高资源语言。
2026年7月23日,由研究团队打造的大规模波斯语合成OCR数据集Persian Pixel正式首发于预印本平台arXiv,为上述行业痛点提供了可落地的解决方案。作为目前公开领域规模领先的标注级波斯语OCR数据集,Persian Pixel包含超过34.3万对高保真图像-文本对,覆盖句子、段落、完整页面等全维度文档布局,其标注文本全部来源于经过专业清洗整理的700万词波斯语语料库,覆盖日常表达、专业文献、历史文稿等多类文本场景,可适配不同垂直领域的模型训练需求。
为了尽可能缩小合成数据与真实文档的域差距,研究团队采用SynthOCR-Gen渲染框架生成数据集图像,生成过程中完整模拟了波斯文字特有的连笔规则、上下文关联的字形变体、变音符号位置逻辑,以及波斯语常用的十余种代表性字体样式;同时叠加了超过25种随机退化模型,可高度还原真实文档的扫描畸变、墨迹渗透、纸张泛黄老化、印刷瑕疵等常见噪声,让合成数据的训练适配性得到大幅提升,无需额外大量清洗即可直接用于模型训练。
目前该数据集主要可用于TrOCR、Donut等主流现代OCR架构的训练与微调,除了支撑波斯语OCR技术研发、合成文档图像生成两大核心方向外,还可广泛应用于波斯语历史手稿批量数字化、跨境政务波斯语文档自动识别录入、中东区域数字出版内容结构化、多语言大模型波斯语文本理解能力优化等多个潜在场景,为字形复杂的低资源语言识别技术落地提供了可扩展、经济高效的数据集构建范式,也为全球多语言数字生态的均衡发展提供了基础数据支撑。





_1769672084863.jpg)