Ora在真实网站上对两者进行对比测试,Vercel的eve步骤减少7%、原生成功率翻倍,两框架使用相同模型。
Ora 的基准测试显示,Vercel 的 eve 相比 Claude Code 步骤减少 7%,在真实网站上原生成功率达到其 2 倍。Claude Code 用户应该评估 eve 在 Web 集成任务中的表现。
Ora 是一个在真实网站上对 AI Agent 进行基准测试的平台,它让 Claude Code 与 Vercel 的 eve 框架在数百个真实用户旅程中展开对决。结果发表在 Vercel 博客上,让 Claude Code 用户难得地看到他们的工具在真实 Web 任务中的表现——不仅仅是写代码。
Ora 的 Agent 会尝试注册产品、与产品集成以及付款。它们经常失败:Ora 估计 99% 的网站尚未为 Agent 做好准备。但基准测试表明,哪种框架能更好地应对这种混乱。
两种框架运行的是相同的模型:Claude Fable 5 和 Haiku 4.5。唯一的变量是框架——即赋予模型工具并逐步驱动它的软件。
Claude Code 是一个编程 Agent。它擅长仓库级任务:编辑文件、运行测试、提交代码。但 Ora 的基准测试考察的是另一类任务:浏览真实网站、填写表单、发起 API 调用。这正是基于 Next.js 构建的 eve 的强项。
对于 Claude Code 用户来说,这并不意味着你的工具已经过时。它意味着:
了解你的用例。如果你是在写代码,Claude Code 仍然是最佳选择。如果你是在构建与 Web 交互的 Agent,可以考虑 eve。
框架比模型更重要。相同的模型(Claude Fable 5)在不同框架下表现不同。框架的工具设计和步骤驱动逻辑影响巨大。
原生成功率是一个差异化因素。eve 2 倍的原生成功率意味着它更频繁地使用网站的实际 UI 和端点,而不是在网页上搜索替代方案。这对于"与这个产品集成"这类任务至关重要。
1. 评估你的 Agent 框架
如果你正在构建与网站交互的 Agent,不要假设 Claude Code 是正确的框架。运行你自己的小型基准测试:
# Test Claude Code on a live site task
claude code "Sign up for a trial at example.com, integrate the API, and make a test request. Report every step."
然后用 eve(如果你在 Vercel 上)或其他框架尝试同样的任务。比较步骤、成功率和成本。
2. 优化原生成功率
如果你的 Agent 过于频繁地回退到网页搜索,这说明框架没有很好地利用网站结构。关注以下几点:
端点发现:框架能否直接找到并调用有效的端点?
UI 交互:它能否在不使用搜索的情况下填写表单和点击按钮?
Prompt 缓存:Ora 在 eve 中发现了一个 prompt 缓存问题,修复后成本降低了 15%。检查你自己 Agent 的缓存情况。
3. 使用 Ora 的 Journey 工具
访问 journey.ora.ai,在你自己的网站上运行一个 journey。你会看到每个 Agent 的成本、延迟和步骤数据。这正是 Ora 用于进行本次对比的相同数据。
Claude Code 仍然是编程的主力,但这次基准测试是一个警钟:对于面向 Web 的 Agent 任务,框架比模型更重要。如果你正在构建需要在真实网站上注册、集成和付款的 Agent,eve 的数据值得关注。但如果你是在交付代码,Claude Code 仍然是你的主力工具——只是要了解它的局限性。
Originally published on gentic.news