GitHub 项目提供完整 OCR 处理能力,专为机器学习训练数据准备优化,直接可用。
项目已重构为模块化、配置驱动的架构。快速开始:
这个 OCR 项目只是开始。在不到一个月内,一个强大的新系统将发布:
一个可定制的 AI pipeline,带有记忆功能 — 为你的领域量身定制。
无论你是学生、研究者还是开发者,你都能够构建自己的智能、记忆增强的 AI — 无需深厚的 AI 知识。
首先,非常感谢你对这个项目的关注。
我原计划在六月之前发布 AI pipeline 的第一个版本。但老实说,我同时在应对一个重大的学术承诺(六月十五号的关键考试)和开发 — 这比我预期的要艰难得多。
与其仓促发布不完整的东西,我决定花更多时间确保发布的东西确实有用、稳定,值得你的时间。
整个系统 — 包括多模态 OCR — 实际上始于一个帮助我自己学习的工具。我没想到它会获得这么多关注,所以谢谢。既然我是第一个用户,我想确保这是我在发布前真正想使用的东西。
开发将在考试后恢复,一旦系统真正准备好,公开发布将随之进行。再次感谢你的耐心 — 我真的很感激。
这个 OCR 系统专门设计用来从复杂的教育材料(如考试试卷)中提取结构化数据,输出格式为机器学习(ML)训练优化的格式。它支持多语言文本、数学公式、表格、图表和平面图形,非常适合创建高质量的训练数据集。
针对 ML 训练优化:提取的图表、表格和图形等元素配备了语义标注和上下文解释。这包括对视觉内容的自动自然语言描述生成(例如,"这个图显示了有丝分裂的四个阶段"),以增强下游模型训练。
多语言支持:支持日语、韩语和英语,可轻松定制以支持其他语言。
结构化输出:生成 AI 就绪的 JSON 或 Markdown 格式输出,包括数学表达式的可读描述、表格摘要和图表标题。
高精度:在真实学术数据集(如 EJU 生物和 UTokyo 数学)上达到 90-95% 以上的精度。
复杂布局支持:准确处理具有密集科学内容、公式繁多段落和丰富视觉元素的考试风格 PDF。
采用技术:DocLayout-YOLO、Google Vision API、Gemini Pro Vision、MathPix OCR、OpenAI API、OpenCV 等。
以下是使用真实教材(2017 EJU 生物与 2014 东京大学数学)生成的系统输出实例,包括英文翻译的语义上下文和提取的数据。
问题 1. 考虑一个以正方形为底、边长为 1 的长方体 OABC–DEFG。点 P、Q、R 分别在线段 AE、BF 和 CG 上,四点 O、P、Q 和 R 在同一平面上。设 S 为四边形 OPQR 的面积。又设 ∠AOP 为 α,∠COR 为 β。(2) 若 α + β = 1 且 S = S,求 tan α + tan β 的值。又若 α ≤ β,求 tan α 的值。
图像描述:此图显示了长方体 OAB–CDEFGQ。每个顶点都用字母标记。角度 α 在面 OAB 上标出。平面 ORPQ 与长方体相交并高亮显示。线段 RC 位于面 ODCG 上,线段 PB 位于面 ABFQ 上。
教学价值:这个图像通过可视化 3D 几何体和截面来增强空间推理能力。它帮助学习者理解平面几何、立体形状、空间可视化和角度等概念。
相关主题:立体几何、截面、棱柱面、三角形、空间推理
考试相关性:这类问题出现在入学考试中,例如:
问题 39. 照片显示了洋葱根尖的细胞有丝分裂过程(体细胞分裂)。细胞 A–D 处于不同的分裂阶段。将阶段(前期、中期、后期、末期)与每个细胞匹配,并从选项 ①–⑧ 中选择正确的组合。
图像描述:此图显示了在显微镜下观察到的植物细胞分裂过程。各种细胞处于不同的有丝分裂阶段,包括在中心排列的染色体(中期)、分离到两极(后期)或形成子核(末期)。
教学价值:这帮助学生直观地理解有丝分裂过程,加强对细胞分裂各阶段及其特征的认识。它与 DNA 复制、癌生物学和遗传学等生物学概念相关联。
相关主题:有丝分裂、细胞周期、前期、中期、后期、末期、DNA 复制
考试相关性:此图像用于以下问题:
摘要:每个选项(①–⑧)对应 A、B、C、D 到前期、中期和后期的特定映射。
教学价值:理解有丝分裂中的时间过渡和表格中的数据组织。增强数据解释、模式识别和分析技能。
相关主题:数据分析、表格解释、生物数据分类
步骤 1 – 初始 OCR 提取 运行 ocr_stage1.py 从输入 PDF 中提取原始元素(文本、表格、图形等)。此步骤执行布局检测并存储中间结果(例如坐标、裁剪图像、原始内容)。
步骤 2 – 语义解释与最终输出 运行 ocr_stage2.py 处理中间数据并将其转换为结构化、可读的输出。这包括生成自然语言解释、摘要,以及将内容组织为 AI 就绪的格式(JSON/Markdown)。
表格处理优化
图像和特殊区域处理
这个 OCR 系统是一个开源项目,我很乐意看到其他人改进或在其基础上构建。持续更新和社区驱动的增强是目标。
如果你对定制 AI 工具感兴趣,或想在与 AI 相关的项目上协作,欢迎通过电子邮件联系:
邮箱:raphael.es.seo@gmail.com
本项目现已获得 GNU Affero General Public License v3.0(AGPL-3.0)许可,符合本仓库使用的 DocLayout-YOLO 模型的原始许可证。
请注意,任何衍生版本或部署版本(包括作为网络服务)也必须公开分享其完整源代码。
更多详情:https://www.gnu.org/licenses/agpl-3.0.html
完整条款见 LICENSE 文件。
⸻ 注:示例中的英文翻译已手动重新格式化以提高清晰度和一致性。请仅将其视为参考,因为结构和布局可能与原始版本略有不同。
关键词:OCR、考试 OCR、表格识别、图表 OCR、AI 教育工具、OpenAI、Gemini Pro Vision、多语言 OCR、DocLayout-YOLO、Machine Learning、教育 ML 数据集、研究 OCR、论文 OCR、文档 AI