LibGDX作者因不满Claude Code自创Pi Agent(85k+ GitHub stars),实测对比:Pi工具使用评测20/30通过、每次成功成本$0.028,远优于Claude Code的16/30与$0.195。
在撰写这篇文章时,我意外发现了一件有趣的事。2026 年最值得关注 coding 智能体 Pi,其开发者居然是因为受够了 Claude Code 才动手写的。🥶
Mario Zechner,libGDX 的创始人,曾是一位深度 Claude Code 用户。他专门开发了 cchistory 来追踪 Claude Code 的系统提示词变化,甚至还对二进制文件打了补丁,添加 Anthropic 尚未发布的功能。
然后他放弃了,转身写了自己的智能体。四个工具,一个极简的系统提示词,没有 MCP,没有权限控制。他给项目起名 Pi,这样就没人能用 Google 搜索到它。真是个狠人!🗿

这个小小的项目如今在 GitHub 上获得了 85k+ star,为 OpenClaw 提供支撑,并在我们的工具使用基准测试中以五分之一的成本超越了 Claude Code。
所以我把两者放在一起对比。一款是所有人都在用的默认之选,另一款是为否定它而生的极简框架。
评分:Pi 6 分,Claude Code 5 分。
Pi 更便宜、更灵活、更透明,尤其适合按 token 计费、切换模型或需要完全掌控的场景。Claude Code 仍然是大多数人的更好的日常驱动器,因为它开箱即拥有更强大的护栏、可预测的订阅定价以及完善的功能集。务实的答案是:日常工作时用 Claude Code,定制工作流、本地模型和对成本敏感的任务用 Pi。
然而反转来了。评分显示 Pi 胜出,但几乎所有同时评测过两者的人——包括最忠实的 Pi 粉丝——仍然把 Claude Code 作为日常驱动器。我接下来会解释原因。
ℹ️ 一个极简、开源的终端 coding 智能体,仅提供四个工具,剩下的由你自己构建。

Pi 是 Mario Zechner 于 2025 年底发布的 coding 智能体,现由 Earendil 维护。Zechner 于 2026 年 4 月加入 Earendil,在一篇标题为"I've sold out"的博文中宣布了这一消息,核心代码保持 MIT 协议开源。
整个产品的设计可以用一句话概括:模型获得读、写、编辑和 bash 四个工具,加上几百 token 的系统提示词,仅此而已。
他的理由是:前沿模型已经经过了 coding 智能体行为的强化学习训练,它们早就知道 coding 智能体是什么了。你不需要用一万个 token 的指令来提醒它们。需要 ripgrep?模型通过 bash 运行 rg。需要 GitHub?它运行 gh。需要浏览器?让 Pi 给自己写一个浏览器工具。
💁 如果你认同这种理念,不妨读一读:Top 10 CLI Tools to Level-Up Claude Code。不需要 MCP,什么都不需要。纯粹的原始 Bash 工具就能完成大部分工作。
最后这句话才是真正的产品所在。Pi 的扩展是 TypeScript 文件,运行在智能体循环的同一进程内,Pi 可以读取自己的源码和文档,所以当你需要某个缺失的功能时,标准的流程是让 Pi 自己构建它。
Zechner 拒绝内置的所有功能,社区在几周内就作为扩展开发出来了。待办清单、计划模式、子智能体、权限门控,甚至 MCP 适配器。

ℹ️ Anthropic 的全功能内置 coding 智能体,也是整个智能体类别用来对标默认产品

这个你肯定知道。Claude Code 起源于 Boris Cherny 2024 年 9 月在 Anthropic 内部写的 AppleScript 小工具,2025 年 2 月进入研究预览期,成为迄今为止增长最快的开发者产品。
它几乎什么都有:10+ 内置工具、子智能体、Agent Teams、计划模式、MCP(既作客户端又作服务端)、Agent Skills、插件、钩子、带回滚的检查点、五种模式的权限系统,支持在终端、VS Code、JetBrains、桌面应用、浏览器和手机端运行。
超过 80% 的 Anthropic 内部工程师每天都在使用它,约"90% 的 Claude Code 代码现在由 Claude Code 自己编写"。🥴
只有理解了 Pi 诞生于 Claude Code 之后,这个对比才有意义。
Zechner 是 Claude Code 的早期用户。他的抱怨从来不是 Claude Code 不好,而是它一直在变化。系统提示词和工具定义在每次更新中都会改变,这破坏了他的工作流,也改变了模型行为。
所以这两款工具代表了对同一个问题的截然相反的答案:前沿模型到底需要多少框架来支撑?
Anthropic 的答案很有趣,因为它正在向 Pi 的方向靠拢。Boris Cherny 的团队在每个新模型发布时都会删除框架代码,2026 年 7 月 Anthropic 为 Claude 5 代模型移除了 Claude Code 超过 80% 的系统提示词,而他们的 coding 评估没有任何可测量的损失。Claude Code 背后的赌注是:Anthropic 同时训练模型和框架,所以今天的脚手架明天就能变成模型内置能力。
Pi 的答案则是:脚手架从来就不是承重结构。
💁 Anthropic 悄悄删除了自己大部分系统提示词,这是对 Pi 理论的最强有力验证。Zechner 只是比他们早了一年而已。
两者底层运行的是同一个循环。读取任务、调用模型、执行工具调用、反馈结果、重复直到模型停止请求工具。

真正的区别在于包裹这个循环的一切。
Claude Code 提供给模型的能力包括:Read、Write、Edit、Bash、Glob、Grep、WebSearch、WebFetch、NotebookEdit、TodoWrite,还有很多……以及可以生成具有独立上下文窗口的类型化子智能体的 Task 工具。计划模式在任何文件被修改前强制进入只读的探索和规划阶段。
Pi 提供给模型四个工具,外加可选的仅读 grep、find 和 ls(通过 -tools 标志启用)。没有计划模式,但 pi --tools read,grep,find,ls 一行命令就能获得一个只读会话。没有子智能体,官方说法是:如果你需要子智能体,让 Pi 通过 bash 运行自己,建议在 tmux 中运行,这样你还能实际观察它的运行。
系统提示词的差距是主要亮点:
一个不太明显的架构差异:Pi 将会话存储为树结构,而不是日志。每条消息都携带父 ID,所以底层实现本质上是一个学会分支的链表。
链表在真实场景中的一个用例。算法刷题总算没白练。🤡
所以 /tree 可以跳回到对话中任何更早的时间点并从那里分支,/fork 则可以从任意过去的消息创建新会话。Claude Code 在 2.0 版本中加入了检查点和回滚,覆盖了常见用例,但 Pi 的树模型是更好的设计。
我们针对真实应用运行了 30 个高难度的 agent 工具使用任务,测试了八个框架,每个框架都接入同一个模型——DeepSeek V4 Flash,通过我们托管的 MCP 路由器,每个任务上限 900 秒。
相同模型、相同任务、相同工具。唯一变化的是框架,所以显示出的任何差距都是框架的问题,而非模型。
以下是两位参赛者的表现:

Pi 通过的任务数量超过了我们测试的八个框架中的任何一个,而且成本是全场最低。成功任务单次成本才是残酷的指标:3 美分对比 19 美分。
Claude Code 的中位时间最快。但它每个任务燃烧了 741,659 个 token,而 Pi 只用了 558,885。框架开销再次成为关键差异。
没错,这是在 DeepSeek 上运行的 Claude Code。这才是这个测试的核心意义。只有框架在变化。
对好奇的读者,Codex 跑了同样的测试,结果是 16/30,总成本 $1.29。刚好在两者之间。

⚠️ 注意:Pi 运行时使用的是高推理模式而非最大推理模式,30 次试验中有 24 次是通过官方 DeepSeek API 而非 OpenRouter 进行的。请结合这个背景阅读具体数字。
Pro,$20/月或年付 $17/月,包含 Claude Code
Max 5x,$100/月;Max 20x,$200/月
⚠️ 各位,请务必核实价格,它经常变动。
这个工具本身免费。MIT 协议,fork 它,用它来开发
你自备任意提供商的 API key,或者通过 Ollama、vLLM 或 llama.cpp 免费运行本地模型
支持在提供商允许的情况下使用 OAuth 登录订阅
理论上 Pi 在价格上胜出,Claude Code 在可预测性上胜出。对于整天使用 Claude 模型的个人开发者来说,$20 固定费率确实难以击败,而重度 Pi 使用按 token 计费每月可达数百美元。我通常更喜欢订阅制。
Anthropic 将其订阅版 OAuth token 锁定为 Claude Code 和 Claude.ai 专用。第三方工具集被切断——1 月悄无声息地在服务端屏蔽,2 月在文档中正式确认,4 月全面执行。OpenClaw、OpenCode、Cline,以及 Pi,都失去了在你的 Claude Pro 或 Max 订阅上运行的权限。

所以现在的实际情况是:通过 Pi 运行 Claude 模型要走 API 费率。通过 Claude Code 运行则用你已付费的便宜订阅。
DHH 称这一举动"对用户极度不友好",笑死。

OpenAI 的 Codex 团队公开走了相反的方向,鼓励第三方工具集的使用。
💁 如果你的工作流每天离不开 Claude 模型,光订阅费用这笔账就基本能决定这个对比的结果。Pi 在 API key 上的成本优势是真实的,但如果你已经付了 Max 套餐那就毫无意义。
Claude Code 运行 Claude。Opus、Sonnet 和 Haiku 层级可用 /model 切换,配合思维 effort 级别,由 Anthropic 掌控全栈调优。
这种垂直整合是模型在工具集中感觉如此宾至如归的原因——它本来就是在这个工具集中训练的。
Pi 则运行一切。Pi-ai 层在 20 多家提供商(从 Anthropic 和 OpenAI 到 Groq、Cerebras、Mistral、OpenRouter 以及本地模型)上统一了四种 API 形态。总计 300 多个模型。你可以在会话中按 Ctrl+P 切换模型,Pi 会在提供商之间转换思维追踪记录。

Claude Code 巨大的 prompt 开销使它不适合小型本地模型——这正是 Simon Willison 将 Pi 标记为该用例轻量级选择的原因。
两个工具都具有深度可定制性。
Claude Code 的模型是外部的、配置驱动的。Hooks 是在 14 个生命周期事件上触发的 shell 脚本,通过 stdin 传输 JSON。MCP 服务器是通过协议通信的独立进程。Skills 是带有懒加载的 markdown 指令包。Plugins 将所有这些打包成可安装的包,通过一个 /plugin 命令即可访问官方和社区市场。
{
"permissions": {
"allow": ["Bash(npm run test *)", "Bash(git status *)"],
"deny": ["Read(./.env)", "Bash(curl *)"]
}
}
Pi 的模型是内部的。Extensions 是加载到与 agent 循环相同运行时的 TypeScript 模块,挂钩 25 种事件类型。它们可以在运行前阻止或重写工具调用、完全覆盖内置工具、注入上下文、替换压缩逻辑、向会话文件持久化自定义状态,并绘制自己的 TUI 小组件。Claude Code 的 hooks 可以批准或拒绝 agent 的行为。Pi 的 extensions 则可以改变 agent 本身。
这里的权衡是信任问题。Claude Code 的市场插件会经过一些检查并在核心进程外运行。Pi 包则以完整系统权限运行,其自身文档告诉你在安装前要先审查。
对 Pi 生态系统最尖锐的批评——来自 thevinter 的"Bad Vibes From Pi"——恰恰落在这里:很多社区 extensions 本身也是凭感觉编程的,所以这值得留意。

这是两个工具之间最大的差异,而且双方都不认为这是缺陷。
Claude Code 默认拒绝。每项风险操作都会先询问你,然后你可以通过五种权限模式、allow 和 deny 规则,以及 OS 级别的 bash 沙箱来放宽限制。
当 Claude Code 发生安全事件——它确实有过附有 CVE 的真实事件——这些问题会被发现、修补并记录在案,因为有数百万人正在使用它。
Pi 没有权限系统。第一条 prompt,就是完整用户权限,干就完了。
Zechner 的论点是,agent 安全大多是"演戏",因为一旦工具能写代码并运行代码,游戏就已经结束了。Pi 对安全问题的答案是隔离而非提示:在 Docker 中运行、在微 VM 中运行、或在沙箱后面运行——如果你想要一个中间地带,还有一个可选的 extension 可以用 YAML 规则检查 bash 命令。
其中一个要求你阅读文档,另一个则保护那个"没看文档的实习生"。
这里没什么好多讨论的。你大概已经知道事情是怎么运作的了……
也许值得看看互联网现在对 Pi 和 Claude Code 的看法?
其实就是我们一直在讨论的那些东西。Pi 获得了大量名人背书,日常使用则集中在 Claude Code——两个事实同时成立。
先给你看 Pi 的好评,因为真的很多。
Peter Steinberger 在 Pi 之上构建了 OpenClaw,转发了 Zechner 的推文并写道:"Mario 是那个我们不配拥有的真正的男人。"Armin Ronacher 写道 Pi 是他"几乎专用的"编程 agent。

t3.gg 的 Theo 做了一整期关于"服用 Pi"的节目。他的观点很简单:"越 minimal 越好。"Wes Bos 和 Scott Tolinski 在一期 Syntax 节目中争论说 Claude Code 对大多数工作来说都 overkill 了。
我最喜欢的一句话来自 IndyDevDan,他称 Pi 是唯一真正的 Claude Code 竞争者:"Claude Code 是新手包。Pi 是终局。"
他大概 80% 的工作仍然走 Claude Code。只有 20% 走 Pi。这个"终局玩家"还在玩新手包。互联网真是太疯狂了!
Claude Code 其实不需要大声吆喝的粉丝。它有 25 亿美元的收入(可能会增加,通过 Claude 本身研究的)、14.1 万 GitHub stars、企业市场的大部分份额,以及据报道微软内部团队也在使用它。这些数字刚刚好够用,哈哈。🤧
选 Claude Code 当你:
选 Pi 当你:
做大多数评审者实际做的事:两个都用。Claude Code 作为你订阅上的主要构建工具,Pi 作为廉价的第二意见、本地模型运行器,以及你自定义工作流的所在地。这两个工具反正也在趋同。
Claude Code 不断删除脚手架,Pi 社区不断把 Claude Code 的功能重建为 extensions。🤡

比分牌显示 Pi 6 分,Claude Code 5 分。说实话,Pi 值得这些胜利。它的每个任务成本更低、开源、支持任何模型。还要啥?
但事情是这样的。当我坐下来面对一个 bug,只想把它修好的时候,我打开 Claude Code。它直接就能用,护栏直接就管用,20 美元套餐让账单稳定,模型在工具里就是如鱼得水。
不用思考工具本身。
这才是整个故事的核心。即使是最铁的 Pi 粉丝,他们大部分工作还是通过 Claude Code 完成的。这是一个秘密。🤫
Zechner 是对的——这些 agent 需要的脚手架比我们以为的要少得多。Anthropic 删除了 80% 的自身 system prompt 基本上就承认了这一点。但正确和成为每个人每天打开的工具是两码事,而 Claude Code 在后者上仍然是我的首选。
所以用 Claude Code 做日常本职工作。Pi 就留着当你想要折腾、本地运行、或者省点钱的时候用。✌️
Shrijal AcharyaFollow