开源项目 DeepRead 将文档转化为「主张-证据」结构化报告,区分原文主张与模型推断,保留数值引用位置和来源上下文。
最近我构建了一个名为 DeepRead 的开源项目,旨在解决我在 AI 阅读工具中反复遇到的一个问题。
大多数工具都能快速总结文档,但它们往往模糊了作者的实际主张、来源提供的证据,以及模型自身的推理之间的界限。对于长文档,来源位置和数值主张的上下文也可能消失。
DeepRead 将文章、书籍、PDF 和文档集转换为围绕主张、证据、数据和关系组织的结构化报告。重要主张与支持证据和来源位置相关联。如果来源未提供证据,报告则如实说明,而不是填补空白。
quick — 获取主要观点和关键要点。
deep — 分析核心主张和论证结构。
map — 生成知识图谱、可信度等级、证据对、数据表、关系和回忆问题。
feynman — 用通俗语言解释材料,识别知识差距,根据来源纠正差距,并创建复习计划。
book — 逐章处理整本书。
DeepRead 还可以比较 2–10 份文档,识别一致之处、冲突和互补证据。
这个便携式 skill 没有额外的运行时依赖:
npx skills@latest add xiehuan123/dsh-deepread
使用示例:
Deep-read architecture.pdf in knowledge-map mode.
For every important claim, show the supporting evidence and page location.
完整插件包含阅读面板、PDF 提取、后端任务、实时进度、批量对比、成本估算,以及 Markdown、HTML 或 XMind 兼容导出。
dsh plugin --profile web add dsh-deepread
GitHub: https://github.com/xiehuan123/dsh-deepread
v0.5.4 Release: https://github.com/xiehuan123/dsh-deepread/releases/tag/v0.5.4
该仓库包含三个真实的输出示例,而非手工伪造的模拟。DeepRead 已被收录进多个 DeepSeek Harness 和 DSH 社区精选集中。其 GitHub Awesome Copilot 提交也已通过自动化规范检查、lint、安装和版本验证,正在等待维护者审核。
仅扫描的 PDF 需要先进行 OCR 处理。
部分采用激进反爬策略的网站可能需要你直接粘贴文章正文。
证据密集型报告比传统摘要消耗更多 token。
该项目采用 MIT 协议许可。我特别希望收到关于一个问题的反馈:
在你的阅读工作流中,显式的主张到证据追溯是否有用,还是让报告变得过于冗长?
Issues 和 pull requests 欢迎提交。
建议的 DEV 标签:showdev, opensource, ai, productivity
建议的 Show HN 标题:Show HN: DeepRead – Evidence-first reading for books, articles, and PDFs