Hugging Face与EleutherAI联合测试14款开源OCR模型,dots.mocr达97.6%字符准确率,千页成本不足2美元,已可直接用于LLM训练数据。
FineBooks 项目是 Hugging Face 与 EleutherAI 的合作成果,研究团队在超过 2000 页历史图书上对 14 个开源 OCR 模型进行了基准测试,评估它们将扫描文本转换为可用于 AI 语言模型训练的干净数据的能力。
小型模型经常超越大型模型,表现最佳的模型在每千页成本低于 2 美元的情况下达到了超过 97% 的字符准确率。
虽然研究人员认为输出质量足以满足 AI 训练需求,但他们指出,这些模型对于学术或科学应用来说仍然错误率过高。
FineBooks 项目由 Hugging Face 和 EleutherAI 联合开展,在超过 2165 页历史图书上测试了 14 个开源权重模型。最佳模型已经能够产生足以用于 AI 训练的文本,但尚未达到学术使用的水准。
训练开源 AI 语言模型使用公共领域图书,意味着要处理大量错误文本。图书馆多年前通过光学字符识别从扫描件中提取了这些文本,结果往往充满错误。Talkie 项目量化了潜在损害:在 OCR 文本上训练的语言模型,学习效率仅为在同一图书的人类转录文本上训练模型的 30%。
FineBooks 是 Hugging Face 与 EleutherAI 的合作项目,测试当前开源 OCR 模型能否解决这个问题。团队在 2165 页历史图书上运行了 14 个开源权重模型,并将结果发布为排行榜。最佳模型在每千页成本低于 2 美元的情况下达到了超过 97% 的字符准确率。
Three of the 2,165 ground-truth pages: a single-column English natural history text, a multilingual table of contents, and an illustration plate whose entire transcription is a single line of artist credit. | Image: FineBooks / Biodiversity Heritage Library

数百万公共领域页面需要更好的文本识别
当 EleutherAI 及其合作伙伴去年发布 Common Pile(迄今为止最大的开放许可训练语料库)时,其中包含约 30 万册公共领域图书,这些文本来自较早前的 OCR 处理。FineBooks 作者表示,使用更好的模型重新处理这些图书是改进开放 AI 训练数据集最有效的方法之一。
该项目选择生物多样性历史图书馆(BHL)作为首个目标,BHL 拥有超过 30 万份数字化自然史文献,总计超过 6400 万页。BHL 通过 AWS 提供批量下载服务。
衡量 OCR 质量需要具有已知正确转录文本的页面。团队使用了 IMPACT 项目和 BHL-Europe 的成果:2011 年至 2012 年间,专家以英语、法语、德语和拉丁语转录了六册 BHL 卷本,错误率约为每 2000 个字符一个错误。该数据以 CC-BY 许可证托管在 GitHub 仓库中,构成了新ground-truth 数据集的基础。
小型模型击败大型竞争对手
所有 14 个模型均免费提供,可在本地硬件上运行,无需 API 密钥。评估指标是字符错误率(CER),即错误识别的字符占比。排行榜将结果分为"字面"(diplomatic)变体和"阅读"(reading)变体,前者将古体字符(如长 sſ)的现代化视为错误,后者则容忍此类变化。
领先的 dots.mocr 模型仅使用 30 亿参数,而 Qwen3.5-9B 尽管体积接近其三倍,得分却更低。OvisOCR2 以仅 9 亿参数位居第二,每千页成本为 46 美分。对于历史文档,模型大小与 OCR 质量并不相关。
评估仅涵盖四种语言的 Antiqua 字体。未涵盖 Fraktur 字体、非拉丁文字母或手写体,FineBooks 仅限于单栏图书页面。团队计划使用其中表现最佳的模型重新处理约 20 万份公共领域 BHL 文档,并将文本作为开放数据集发布。新模型将持续添加到排行榜中,评估框架也是开源可用的。
足以用于 AI 训练,但对学术研究仍不够精确
FineBooks 作者根据预期用途来判断结果。他们写道,对于训练语言模型来说,表现最佳的模型已经足够好用。这些模型产生的错误远少于旧的处理流程,以测量到的成本重新处理 BHL 规模的藏品是可行的。
团队指出,图书馆面临不同的问题。其系统依赖 ALTO XML 格式,这是一种具有词级坐标的格式。新模型输出 Markdown 或纯文本,不含词位置信息,因此无法接入现有图书馆基础设施。
对于学术转录来说,准确度仍然不够,但不是因为模型误读字符。它们无声地将其现代化,将长"s"或连字替换为现代等价物。团队表示,针对性的微调可以解决这个问题。