开源OCR模型能否解锁历史知识?FineBooks基准测试给出答案

10 阅读

历史文献数字化的新机遇

过去几十年,全球图书馆将数百万册历史书籍数字化,其中大量已进入公共领域。这些扫描页面的文字提取主要依赖光学字符识别(OCR)技术,但多数图书馆仅在扫描时运行一次OCR,使用的工具和流程往往已过时。随着视觉语言模型(VLM)的快速发展,新一代OCR模型在准确率上实现了质的飞跃,且多数以开放权重和开放许可发布,任何人都可以免费使用。然而,这些模型主要针对现代文档优化,历史书籍的复杂性——如古老字体、复杂版式、多语言混排——对它们构成了严峻挑战。

为什么更好的OCR至关重要

高质量的OCR不仅方便读者和研究者,更是开放AI模型训练的关键。公共领域书籍是最大的长文本自由来源之一,但前提是文本质量足够高。Talkie项目的研究表明,基于OCR文本训练的模型,其学习效率仅为基于人工转录文本的30%。EleutherAI发布的Common Pile语料库包含约30万本公共领域书籍,其文本来自早期OCR流程。用更好的OCR模型重新处理这些书籍,是提升开源AI训练数据集质量的最有效途径之一。

FineBooks项目:目标与方法

FineBooks是Hugging Face与EleutherAI的合作项目,旨在回答一个关键问题:当前的开源OCR模型是否足够好,能够大规模解锁历史知识?项目选择生物多样性遗产图书馆(BHL)作为首个处理对象,该馆拥有超过30万册历史自然历史文献,共6400万页。项目第一阶段发布了三个核心成果:

  • FineBooks BHL OCR排行榜:评估14个开源OCR模型在2165页历史书籍上的表现
  • finebooks/bhl-impact-gt:由专家转录的地面真值数据集
  • finebooks/bhl-ocr-eval:开源评估工具,便于复现和扩展

地面真值:专家转录的宝贵遗产

构建可靠的OCR评估需要精确的转录文本。2011-2012年间,IMPACT项目和BHL-Europe合作,对BHL的六卷书籍进行了专家校正转录,涵盖英语、法语、德语和拉丁语,共2165页,错误率约为每两千字符一个错误。这些转录在CC-BY许可下发布,并保存在GitHub上。尽管项目早已结束,但这份开放数据至今仍具有极高的评估价值。FineBooks团队将这些转录与现代BHL扫描图像匹配,构建了标准化的地面真值数据集。

评估流程:高效且可复现

评估采用Hugging Face Jobs进行,每个模型处理全部2165页,成本从几美分到几美元不等。所有运行都固定了模型版本、容器镜像和脚本提交,确保结果可复现。新增模型只需提交一次作业即可加入排行榜。

核心指标:不止于字符错误率

字符错误率(CER)是OCR质量的标准度量,但单一指标可能掩盖重要差异。排行榜额外报告了以下指标:

  • 两种CER变体:外交式CER将古字形(如长s)的现代化视为错误,而阅读式CER则视为正确。这取决于应用场景是学术转录还是现代阅读。
  • 召回率:模型正确输出的单词占页面应有单词的比例,防止模型静默丢弃脚注等内容。
  • 过度提取:模型在空白页或插图页生成文本的比例,VLM模型常出现此问题。
  • 循环率:模型重复生成直到达到token上限的页面比例,这些页面被排除在其他指标之外,需结合解读。

主要结果:开源模型表现亮眼

排行榜显示,顶尖模型在阅读式CER上达到97.6%的准确率,成本低至每千页0.34美元。例如,dots.mocr以3B参数实现97.6%准确率,成本1.94美元/千页;OvisOCR2以0.9B参数达到96.9%,成本仅0.46美元。这些模型在速度和成本上均优于传统OCR流水线。

是否足够好?分场景评估

  • 用于LLM训练语料:是。领先模型的字符错误率远低于现有语料,且成本可控,重新处理BHL规模的公共领域藏书是可行的。
  • 用于图书馆替换旧OCR:视情况而定。新模型输出Markdown或纯文本,缺乏ALTO XML的单词级坐标,无法直接融入现有图书馆系统。
  • 用于学术转录:尚不完美。模型会静默现代化古字形,而学术转录要求保留原貌,但通过针对性微调有望解决。

局限与未来方向

当前评估仅覆盖四种语言和antiqua字体,不涉及Fraktur、非拉丁文字或手写体。项目专注于书籍类文档,未涵盖报纸、杂志等复杂版式。未来,排行榜将随新模型发布持续更新,并计划重新处理BHL全部公共领域藏书,发布首个FineBooks数据集。所有工作将在开放原则下进行,共享经验与工具。

A multilingual table of contents from the 1881 proceedings of the Russian Entomological Society

结语

开源OCR模型在历史文献识别上已取得显著进展,但距离完美仍有差距。FineBooks项目通过严谨的评估和开放的数据,为图书馆和AI社区提供了宝贵的决策依据。随着技术的不断进步,历史知识的解锁将变得更加高效和普及。