前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8479
  • 推理模型隐藏思考过程的四种方式及计费陷阱
  • AI Agent 将漏洞利用开发压缩至分钟级
  • Pi Agent:统一多模型 LLM API 的 AI 编程 Agent 工具链
  • LibreChat v0.8.8 RC:ChatGPT 克隆支持 Agent 管理 API
  • LandingAI 文档智能抽取 Gen2:原子级引用+按字符计费
  • 不用向量数据库做个人 RAG:grep 级检索也够用
  • Claude Code vs Cursor:按任务场景选择 AI 编程工具的完整指南
  • 2026 年五大主流模型生产选型指南
  • Agent 记忆层测试:六条真正能发现腐化的断言
  • Agent 生成的限流器如何绕过多租户隔离测试
  • 周末 Agent 项目攻略:用permit文件管控写操作
  • squash-merge 后 HEAD~1 指向无关代码的 Agent bug 分析
  • AI 生成的 Schema 变更:别让自由派 Diff 绕过锁
  • AI 写的代码编译过了,但环境变量、锁文件、日志全踩坑
  • Skild AI S1:仅凭一段视频,机器人学会翻煎饼
  • Java 27 发布:后量子 TLS 与对象头压缩等 9 项 JEP
  • DeepSeek 算子负责人自述:AI 一年内从查文档到独立优化 CUDA 算子
  • 编程任务 LLM 大模型盲测:4 款模型代码质量实测
  • Agent 循环常见路径陷阱自查清单
  • 你的 CDN 可能正在偷偷屏蔽所有 AI 爬虫
  • 我用Electron给Meta Muse Code CLI做了个桌面客户端,核心教训是PTY交互设计
  • Simon Willison 实战:通过 WebSocket 在浏览器里调 Gemini Live
  • 谷歌TPU集群迈入百万芯时代,电力成AI扩张核心瓶颈
  • AI 对话机器人的隐藏指令系统详解
  • 2026 年生产级 AI Agent 的上下文工程指南
  • OpenAI Agent 被指批量投毒 RubyGems 事件分析
  • Google 发布 Gemini 3.8 Live:支持 97 语言实时切换的语音 Agent 模型
  • AI 爬虫实际读取的是原始 HTML 还是渲染后 DOM
  • Next.js/Node单仓库中多租户邮件定时任务的安全隔离实践
  • AI Agent 真实生产故障:可观测性与恢复模式
  • 美国政府令 Anthropic Fable 5 下线事件
  • Google发布Gemini 3.8 Live语音模型,价格仅为GPT-Live-1的零头
  • Gemini企业平台零信任AI Agent运行时防护
  • AI Agent 正在冲垮生产环境:构建 SDLC 防护栏的工程实践
  • Gemini 3.8 Live 发布:扩展思考能力版本登场
  • 已加载 35 / 8479
8.0
热点
AI SCORE
技术实践2026-09-16 14:33

LandingAI 文档智能抽取 Gen2:原子级引用+按字符计费

dev.to · AI#LandingAI#文档 AI#RAG
Editor brief · 编辑速览

第二代文档智能抽取平台,新 DPT-3 模型系列(Pro/Verity),输出结构从 chunk 升级为带稳定 ID 的 Block,引用精度达行级/词级,API 按返回字符数而非页数计费。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

LandingAI 的 Agentic Document Extraction(我们称之为 ADE)现已推出第二代,本文涵盖开发者基于此构建时的变更内容。ADE Gen2 基于我们全新的 DPT-3 模型系列运行,它改变了三个决定 Agent 能否对文档进行操作的要素:输出结构、可溯源性(grounding)和成本。我们的完整发布公告包含全部细节,你可以点击这里阅读:Introducing Agentic Document Extraction, 2nd Generation。以下是面向开发者的版本,围绕我们听到最多的问题组织。

一览

什么让文档管道成为 Agentic,它与传统 IDP 和 OCR 有何不同?

Agentic 文档管道以一种仔细的人阅读页面的方式读取页面,并返回 Agent 可直接操作的结构,无需人工重新阅读。LandingAI 的 ADE 通过 DPT-3 实现这一能力,DPT-3 在读取文字之前先读取页面布局,然后逐行深入到单个文字和表格单元格。传统 OCR 和模板驱动的 IDP 将页面压平成松散的文字,依赖人工在事后恢复其含义。一旦将两种方法并排比较,差异就清晰可见了。

哪个文档 AI 能显示页面上每个答案的来源,并让你对每个值进行验证?

LandingAI 的 ADE 对每个元素进行原子级溯源,所以你可以精确看到页面上每个值的来源,并将每个提取值追溯回源——这正是使提取在受监管工作流中可辩护的原因。Gen2 引入了原子溯源,意思是在最小的结构单元级别进行溯源,具体级别取决于 Parse 模型:

  • DPT-3 Pro 溯源到行:每个文本行都携带自己的跨度指针和边界框,覆盖所有块类型
  • DPT-3 Verity 溯源到词:每个词都携带自己的跨度指针、边界框和置信度分数
  • 表格单元格溯源现在为每个单元格添加边界框,比 Gen1 更精细

在 Extract 侧,Extract V2 将这种溯源转化为原子引用,所以你拉取的任意值都能追溯到某一页上的特定词,你在 Extract V1 上构建的 schema 可以无缝迁移。如此精细的溯源是过去无法构建的工作流的基础:精细到词、行或单元格的本地化 PII 和 PHI 删除;突出显示版本差异的文档比较;以及人工审核界面,审核者在原地编辑 Markdown。

面向 API 优先管道的干净结构化 JSON

ADE Gen2 返回干净的结构化 JSON,专为 Agent 消费设计,而非供人阅读——这也是你在为 RAG 准备结构化输出时下游系统和向量数据库想要的。我们从零重建了 API 响应,对于任何在代码中解析它的人来说,三个变更最为关键:

  • chunks 被 blocks 取代,每个 block 携带一个稳定 ID
  • 全新的顶级结构对象暴露每个 block 的页码、字符范围、边界框和原子溯源,Agent 可直接遍历响应
  • Markdown 标准化,所以图形、复选框和表格每次调用都以相同方式返回,表格以 HTML 形式交付以保留纯 Markdown 会压平的结构

你的 Agent 每次运行都读取可预测的形状,这消除了一整类需要手动防御的解析边缘情况。

哪个平台提供 SDK 和异步作业用于大规模程序化处理?

ADE Gen2 在 v2 API 上提供两个客户端库 ade-python 和 ade-typescript,以及命令行 ADE CLI,外加大规模程序化工作的异步 Jobs API。Parse Jobs 运行大规模异步解析,Extract Jobs 将你定义的字段拉取为结构化 JSON。两者共享同一个作业模型和同一个响应信封,所以跨平台提交工作和获取结果的流程保持一致:

  • Parse Jobs 处理最多 6,000 页或每个 PDF 1 GB 的异步解析
  • Extract Jobs 处理异步字段提取为结构化 JSON,支持 Priority 和 Standard 层级
  • 统一作业模型给你跨两者共享的响应信封和作业 ID 格式,完成的作业通过 webhook 通知

面向混合文档工作负载的定价

Parse 现在按返回的字符数计费,而非按你发送的页数,所以轻量页费用最低,密集页费用更高——DPT-2 则是每页固定 3 credits。服务层级提供了第二个调节杠杆,Priority 1.0x 用于需要等待响应的场景,Standard 0.5x 作为管道的默认选项,模型选择提供了第三个:

  • DPT-3 Pro,现已可用,适用于复杂页面:布局、图形、手写、扫描、非拉丁文字母和数学
  • DPT-3 Verity,公开预览中,适用于数字文本和表格,消耗约为 Pro 的 40%
  • 2026 年秋季上线两个模型间的自动路由

跨混合工作负载我们预计成本降低 25% 到 80%,Standard 层级的 DPT-3 Verity 将基本页面费用降至每页不到 1 美分。完整的模型和按 credit 计费的详细计算见我们的定价核心概念指南。

ADE Gen2 现已上线,最快看到差异的方式是访问 ade.landing.ai 用你自己的文档跑一遍。完整变更列表见我们的完整发布公告:Introducing Agentic Document Extraction, 2nd Generation。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
LibreChat v0.8.8 RC:ChatGPT 克隆支持 Agent 管理 API
下一篇
不用向量数据库做个人 RAG:grep 级检索也够用