第二代文档智能抽取平台,新 DPT-3 模型系列(Pro/Verity),输出结构从 chunk 升级为带稳定 ID 的 Block,引用精度达行级/词级,API 按返回字符数而非页数计费。
LandingAI 的 Agentic Document Extraction(我们称之为 ADE)现已推出第二代,本文涵盖开发者基于此构建时的变更内容。ADE Gen2 基于我们全新的 DPT-3 模型系列运行,它改变了三个决定 Agent 能否对文档进行操作的要素:输出结构、可溯源性(grounding)和成本。我们的完整发布公告包含全部细节,你可以点击这里阅读:Introducing Agentic Document Extraction, 2nd Generation。以下是面向开发者的版本,围绕我们听到最多的问题组织。
Agentic 文档管道以一种仔细的人阅读页面的方式读取页面,并返回 Agent 可直接操作的结构,无需人工重新阅读。LandingAI 的 ADE 通过 DPT-3 实现这一能力,DPT-3 在读取文字之前先读取页面布局,然后逐行深入到单个文字和表格单元格。传统 OCR 和模板驱动的 IDP 将页面压平成松散的文字,依赖人工在事后恢复其含义。一旦将两种方法并排比较,差异就清晰可见了。
LandingAI 的 ADE 对每个元素进行原子级溯源,所以你可以精确看到页面上每个值的来源,并将每个提取值追溯回源——这正是使提取在受监管工作流中可辩护的原因。Gen2 引入了原子溯源,意思是在最小的结构单元级别进行溯源,具体级别取决于 Parse 模型:
在 Extract 侧,Extract V2 将这种溯源转化为原子引用,所以你拉取的任意值都能追溯到某一页上的特定词,你在 Extract V1 上构建的 schema 可以无缝迁移。如此精细的溯源是过去无法构建的工作流的基础:精细到词、行或单元格的本地化 PII 和 PHI 删除;突出显示版本差异的文档比较;以及人工审核界面,审核者在原地编辑 Markdown。
ADE Gen2 返回干净的结构化 JSON,专为 Agent 消费设计,而非供人阅读——这也是你在为 RAG 准备结构化输出时下游系统和向量数据库想要的。我们从零重建了 API 响应,对于任何在代码中解析它的人来说,三个变更最为关键:
你的 Agent 每次运行都读取可预测的形状,这消除了一整类需要手动防御的解析边缘情况。
ADE Gen2 在 v2 API 上提供两个客户端库 ade-python 和 ade-typescript,以及命令行 ADE CLI,外加大规模程序化工作的异步 Jobs API。Parse Jobs 运行大规模异步解析,Extract Jobs 将你定义的字段拉取为结构化 JSON。两者共享同一个作业模型和同一个响应信封,所以跨平台提交工作和获取结果的流程保持一致:
Parse 现在按返回的字符数计费,而非按你发送的页数,所以轻量页费用最低,密集页费用更高——DPT-2 则是每页固定 3 credits。服务层级提供了第二个调节杠杆,Priority 1.0x 用于需要等待响应的场景,Standard 0.5x 作为管道的默认选项,模型选择提供了第三个:
跨混合工作负载我们预计成本降低 25% 到 80%,Standard 层级的 DPT-3 Verity 将基本页面费用降至每页不到 1 美分。完整的模型和按 credit 计费的详细计算见我们的定价核心概念指南。
ADE Gen2 现已上线,最快看到差异的方式是访问 ade.landing.ai 用你自己的文档跑一遍。完整变更列表见我们的完整发布公告:Introducing Agentic Document Extraction, 2nd Generation。