AI消息速览

Persian Pixel:面向波斯语的大规模合成OCR数据集

事件日期 2026-07-22 · 学术前沿 · 已接受

事件日期2026-07-22
信息日期2026-07-22
入库日期2026-07-23
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:Persian Pixel:面向波斯语的大规模合成OCR数据集

一句话结论:Persian Pixel 是首个公开的大规模合成波斯语OCR数据集,包含超过34.3万对高保真图像-文本对,通过模拟波斯文字特征与真实文档退化,为训练和微调现代OCR模型(如TrOCR、Donut)提供了可扩展的资源,有效缓解了波斯语OCR长期面临的数据稀缺问题。

事件概述:波斯语(波斯语使用者超过1.1亿人)的OCR技术远落后于拉丁语系,主要由于波斯-阿拉伯文字系统的固有复杂性(如强制连笔、上下文相关字形、大量连字、变音符号等)以及大规模高质量标注数据的匮乏。为此,该研究从精心策展的700万词波斯语语料库出发,使用SynthOCR-Gen渲染框架生成了句子、段落和整页三种布局的图像-文本对,并通过25种以上随机退化模型模拟真实文档获取伪影(如墨迹渗散、纸张老化、模糊、光照变化等),最终构建了Persian Pixel数据集。

方法/产品要点

  • 数据集规模:超过343,000对高保真图像-文本对,覆盖句子、段落、整页文档布局。
  • 生成框架:SynthOCR-Gen渲染框架,忠实建模波斯文字的排版特征:上下文字符连接、位置变体字形、变音符号放置、多种代表性波斯字体(如Naskh、Nastaliq)。
  • 域适应:通过25种以上随机退化模型弥合合成到真实的域差距,包括墨水渗散、纸张老化、模糊、光照变化、扫描仪缺陷、压缩伪影、多种噪声。
  • 使用场景:适用于训练和微调现代OCR架构,包括基于Transformer的模型如TrOCR和Donut。

主要结果或产业意义

  • Persian Pixel 公开可用,为波斯语文档分析、历史手稿数字化、端到端文档理解提供了坚实基础。
  • 验证了程序化合成数据生成是手动标注的实用、经济且可扩展的替代方案,尤其适用于低资源且文字复杂的脚本。

为什么重要

  • 填补了波斯语OCR领域长久以来的标注数据空白,此前该领域因手动标注成本高、难度大而进展缓慢。
  • 与已有相关卡片(如大规模真实世界多变量时间序列语料库、AI智能体技能库)不同,本卡片聚焦于OCR领域的合成数据资源与语言多样性,展示了合成数据在应对非拉丁文字系统复杂性方面的潜力(增量信息)。

局限与不确定性

  • 数据集完全为合成生成,其泛化到真实场景的效果仍有待独立评估(待核实)。
  • 覆盖的字体和文档样式有限,可能无法涵盖所有波斯语书写变体(如手写体)(待核实)。
  • 退化模型虽多样,但能否完全模拟真实世界文档的所有退化情况未明确量化(待核实)。

可用于图书/PPT/简报的角度

  • 案例:如何用合成数据解决低资源语言的OCR瓶颈。
  • 技术要点:合成数据生成中的域适应策略(光照、噪声、纸张退化等)。
  • 启示:对于其他复杂文字(如阿拉伯语、乌尔都语)的OCR发展具有借鉴意义。

原始材料

  • 英文标题:Persian Pixel: A large-scale synthetic OCR dataset for Persian language
  • 英文关键词:Optical Character Recognition, Persian, synthetic dataset, OCR, document digitization
  • 来源:arXiv:2607.20385v1, https://arxiv.org/abs/2607.20385v1