Pydantic官方Agent框架,通过Pydantic模型保证LLM输出结构化,45天生产使用后评价优于LangChain。
Pydantic AI 是什么
Pydantic AI 是 Pydantic 团队官方的 agent 框架,构建在类型化、经过校验的 LLM 输出之上。经过 45 天用于 saas.pet 的内容 QA agent 和数据提取脚本后,这里是关于结构化输出、工具调用,以及为什么它在类型化 Python 工作流上比 LangChain 更好的真实故事。
Pydantic AI 实际上是什么
Pydantic AI 是 Pydantic 团队官方的 agent 框架,Pydantic 是 Python 中最流行的数据验证库。它于 2024 年中发布,到 2026 年已发展成为一个完整平台:具备工具调用的 agent、由 Pydantic 模型保证的结构化输出、流式处理、可观测性,并支持实时语音、图像生成和 embeddings。标语是「How Python does AI」,定位是端到端类型化。截至 2026 年 8 月,该仓库有 19,446 颗星,MIT 许可证,最新版本是 2026-08-21 的 v2.33.0,项目在积极迭代中。其核心承诺是它的差异所在:当你向 LLM 请求结构化数据时,你用 Pydantic 模型定义形状,框架负责让模型产生能通过校验的输出,包括在校验失败时自动重试。
为什么我尝试它:saas.pet 的内容 QA 问题
saas.pet 发布长篇 AI 工具评测,我想需要一个自动化的质量门:一个能阅读评测草稿并按评分标准检查、返回带分数和问题的结构化报告的 agent。在 Pydantic AI 之前,这意味着用提示词请求 JSON,然后 json.loads,然后祈祷字段匹配,然后再为模型返回「以下是 JSON:」这种格式前面夹带杂质内容的情况写防御性代码。当时大约 70% 的时间能正常工作,但会消耗数小时的调试时间。Python 社区的一位同事向我推荐了 Pydantic AI,效果立竿见影:我定义了 ReviewCheck 模型,字段包括 overall_score、issues 作为类型化条目列表,以及 recommendations,agent 每次都精确返回这些,校验错误会被暴露而不是返回静默错误的数据。第一个可用版本花了我一个下午,从那以后我再也没有写过基于 json.loads 的 LLM 集成。
结构化输出:杀手级功能
Pydantic AI 的核心是带校验的结构化输出。你将预期响应定义为 Pydantic 模型,框架约束 LLM 产生匹配的输出,底层使用工具风格的 schema 调用。如果模型返回的内容校验失败,框架会用校验错误反馈进行重试,你可以设置重试限制。实际上这意味着输出是类型化的:我的内容 QA agent 返回一个 ReviewCheck 对象,包含一个 int 分数和问题列表,我的代码直接访问 check.overall_score,无需任何解析或防御性检查。我也用它做数据提取,从网页中提取结构化的工具信息到 JSON,字段如 name、pricing 和 category,相比自由格式的提示,可靠性有如天壤之别。对于任何 LLM 集成涉及解析 JSON 的场景,这消除了一整类 bug。
Agent、工具和框架模型
除了结构化输出,Pydantic AI 还提供了完整的 agent 框架:带系统提示词的 agent、带类型化签名的工具注册、多 agent 编排,以及与模型无关的 providers。工具调用的类型化方式与输出相同:定义一个带类型参数的 Python 函数,向 agent 注册它,框架处理模型调用该函数的过程。我有一个 agent 使用网页抓取工具检查某工具的官网是否可访问,然后我才批准一篇评测,类型化的工具契约意味着无需对参数做字符串匹配。框架还处理 agent 依赖和结果流式处理,现在还有实时语音 API,我只在上面玩过,但它显然是方向。框架模型更接近 LangGraph 的显式图方法而非 LangChain 的链,这符合我思考 agent 逻辑的方式。
与 LangChain、LangGraph 和 OpenAI Agents SDK 的比较
对比 LangChain,Pydantic AI 在 Python 项目的类型化、简洁性和可维护性上胜出。LangChain 更广泛,有数百种集成,但这种广度带来了复杂性,使得调试更难。对于类型化、可靠的 LLM 输出,Pydantic AI 是更好的默认选择。对比 LangGraph,比较的是编排深度:LangGraph 的图模型更复杂,适用于繁复的多 agent 工作流,而 Pydantic AI 更轻量、更 Pythonic,对于绝大多数 agent 用例,它的模型足够用。对比 OpenAI Agents SDK,差异在于语言哲学:SDK 以 OpenAI 为中心,有一等一的 OpenAI 特性的支持,而 Pydantic AI 是 provider 无关的、原生 Pydantic 的。如果你全力投入 OpenAI,SDK 没问题。如果你使用多个 providers 或重视类型化输出,Pydantic AI 更合适,它支持 OpenAI、Anthropic、Google,以及通常的本地选项如 Ollama。
定价和生态系统
Pydantic AI 采用 MIT 许可证,免费。成本是你调用的模型,框架本身几乎不增加额外开销,除了 API 调用本身,这比一些插入代理层的框架更好。模型支持覆盖 OpenAI、Anthropic、Google Gemini、Mistral、Groq,以及 OpenAI 兼容端点,这意味着 DeepSeek 和其他廉价 providers 可以通过兼容路径使用。还有 Pydantic Logfire,来自同一团队的可观测性平台,它与框架集成用于追踪 agent 运行;有免费层,我用它来查看我的 QA agent 何时重试或校验失败。围绕该框架的生态系统正在增长,Pydantic 品牌在 Python 社区有分量,这意味着项目不太可能被废弃。文档确实很好,有可运行的示例。
局限性和最终结论
诚实的局限性。首先,该框架假设你熟悉 Pydantic 模型和 Python 类型化,这对大多数 Python 开发者来说很自然,但如果你来自动态类型思维则是一道门槛。其次,带分支逻辑的复杂多 agent 编排是可能的,但不如 LangGraph 的图模型富有表现力,所以非常大的 agent 系统可能会超越它。第三,发布节奏很快,v2.33.0 还在继续,这意味着小版本之间偶尔会有破坏性变更,你应该锁定版本。第四,实时语音和图像生成是较新功能,仍在成熟中。谁应该跳过 Pydantic AI:任何不写 Python 的人,以及任何对 LangChain 有大量现有投入的人。对于用 Python 构建 agent 或 LLM 功能的开发者,这是 2026 年可用的最佳框架,我给它打 5 分。
This review originally appeared on saas.pet — I test AI tools with my own money and write about what actually works.