8.0
热点
AI SCORE
编程提效2026-09-18 03:00
Vercel Sandbox支持Terminal-Bench等 Harbor评测
Vercel Blog#Vercel#AI评测#开发者工具
Editor brief · 编辑速览
Vercel支持在云端隔离微VM中运行SWE-bench、Terminal-Bench等AI代码能力基准测试,可横向对比数百模型的编程表现。
你可以在 Vercel Sandbox 上运行 Harbor 评估任务了。
Harbor 是 Terminal-Bench 的开源测试框架,其评测库还包含许多其他基准测试,如 SWE-bench、tau3-bench 和 OSWorld。传入 --env vercel 给 harbor run,每次 trial 都在独立的 Firecracker 微 VM 中执行,因此可以实现远超本地机器能力的并行化。
任务的网络策略在沙箱防火墙层面强制执行,位于 VM 之外。可选的凭证注入机制在防火墙处将密钥附加到匹配的出站请求上,因此密钥永远不会进入沙箱。
配合 AI Gateway 使用,一个 AI_GATEWAY_API_KEY 即可访问来自多个提供商的上百个模型,换一个 --model 跑同样的基准测试即可评测另一个模型:
1uv tool install 'harbor[vercel]'2export VERCEL_TOKEN="<your-token>"3export AI_GATEWAY_API_KEY="<your-key>"45harbor run -d terminal-bench/terminal-bench-2-1 \6 --agent fx \7 --model vercel_ai_gateway/anthropic/claude-fable-5 \8 --env vercel \9 --n-concurrent 8
将 --model 换成 vercel_ai_gateway/openai/gpt-5.6-luna 即可用同一个命令对 OpenAI 模型跑同样的基准测试。
需要 Harbor 0.22.0 或更高版本。详细的安装配置与故障排查请参阅分步指南。更多内容请参阅 Sandbox 文档。