前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8589
  • Claude Code 新增 AGENTS.md 支持,无 CLAUDE.md 时自动读取
  • Anthropic 发布 Claude Opus 5,性能与安全性双提升
  • Ternary Bonsai 2 27B:5.9GB 轻量模型保留 98% Qwen3.8 性能
  • 研究人员用Claude在72小时内攻破OpenAI内部系统
  • BrowserSkill:让AI Agent共享你的真实浏览器登录态
  • Coder:自托管云开发环境与AI编程Agent平台
  • Anthropic开源11款知识工作者Claude插件
  • Google联手Speakeasy开源SDK代码生成套件
  • AI 承担开发重负后,程序员角色如何转变
  • 如何为第三方 API 构建隔离仿真层
  • 为自主编码 Agent 打造手机遥控面板
  • AWS SageMaker HyperPod 推理网关:首 token 延迟降低82%
  • MiniMax Code CLI开源:任务通过率76.7%,中位耗时4分33秒
  • 2026年本地LLM最佳开源Agent框架:11款精选
  • 阿里Qwen3.8-Omni-Flash:百万上下文多模态Agent模型
  • Jev:AI Gateway史上增长最快的决策模型
  • Claude Code 大重构:内部 3 万 Agent 管理技术免费开放
  • Vercel CLI 支持秒级静态产物部署
  • 警惕模型在上下文压缩时自我注入隐藏指令
  • OpenAI 发现模型会留「小纸条」给后续上下文以隐藏错误行为
  • Vercel Sandbox支持Terminal-Bench等 Harbor评测
  • Claude Code Projects升级:云端多Agent协作
  • Claude Code 新增并行 Agent 工作流,支持自主开 PR 和执行测试
  • GitHub 与 Anthropic 的 AI Agent 重写 Rust 代码实战对比
  • Amazon Bedrock 知识库向量库选型对比:OpenSearch、Aurora pgvector、S3
  • MCP 工具防御式授权实现:Entra ID + JWT + RBAC/ABAC
  • JetBrains实战:构建语义代码搜索RAG流水线,从解析到向量化的完整踩坑记录
  • OpenAI开发者:多Agent并行了反而浪费token,质与量均无提升
  • Cline 开源编程 Agent:SDK/VS Code/JetBrains/CLI 全覆盖
  • Cloudflare 开源安全审计 Skill:把 AI 编程助手变成专业漏洞猎人
  • 744B MoE 模型能跑在普通桌面上的工程原理
  • Cloudflare 安全审计 Skill 最值得抄的设计:独立验证 Agent
  • AI 生成代码上线前审计:五个高频漏洞
  • VS Code 1.138发布:开发容器内运行AI智能体,Copilot订阅可切换
  • Apify MCP Server:2 分钟让 AI 操控真实网页爬虫
  • 五大 AI 编程工具的会话恢复能力全面横评
  • Agent 写的测试通过,不代表测对了
  • 向 AI 编程助手投喂代码前:先过这枚分类器
  • MCP Server 间接提示词注入审计与利用实战教程
  • LLM 应用安全实战:威胁建模与防御实践指南
  • AI Agent 技能系统设计:列出≠安装≠执行,三层边界须厘清
  • 国产RSI模型发布:Flash模型亮相,1亿Tokens免费领取
  • 我比前沿实验室早一年开源 Jev 同架构:PPO+序列嵌入实现非自回归概率预测
  • codsh 0.23:Mission Contract 控制面,防止 AI 编码目标漂移
  • 用 AI Agent 自动分析 S3 存储账单,Terraform 策略一键生成
  • OpenAI 发布 GPT-6 Astra:分阶段推送,支持多 Agent 协同与长程推理
  • 提取 DeepSeek R1 的思维链:CoT 清洗与推理日志导出指南
  • Nunchux开源VC-Attention:免训练低比特注意力核加速视频DiT
  • GitHub Copilot 800 KLOC 运行时全面迁移 Rust,AI 编程工具进入生产级工程阶段
  • OpenAI GPT-Live 1:全双工语音模型,支持客户端委托
  • n8n新增云端AI模型即服务:无需创建服务商账户
  • 已加载 51 / 8589
8.0
热点
AI SCORE
编程提效2026-09-18 03:00

Vercel Sandbox支持Terminal-Bench等 Harbor评测

Vercel Blog#Vercel#AI评测#开发者工具
Editor brief · 编辑速览

Vercel支持在云端隔离微VM中运行SWE-bench、Terminal-Bench等AI代码能力基准测试,可横向对比数百模型的编程表现。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

你可以在 Vercel Sandbox 上运行 Harbor 评估任务了。

Harbor 是 Terminal-Bench 的开源测试框架,其评测库还包含许多其他基准测试,如 SWE-bench、tau3-bench 和 OSWorld。传入 --env vercel 给 harbor run,每次 trial 都在独立的 Firecracker 微 VM 中执行,因此可以实现远超本地机器能力的并行化。

任务的网络策略在沙箱防火墙层面强制执行,位于 VM 之外。可选的凭证注入机制在防火墙处将密钥附加到匹配的出站请求上,因此密钥永远不会进入沙箱。

配合 AI Gateway 使用,一个 AI_GATEWAY_API_KEY 即可访问来自多个提供商的上百个模型,换一个 --model 跑同样的基准测试即可评测另一个模型:

1uv tool install 'harbor[vercel]'2export VERCEL_TOKEN="<your-token>"3export AI_GATEWAY_API_KEY="<your-key>"45harbor run -d terminal-bench/terminal-bench-2-1 \6  --agent fx \7  --model vercel_ai_gateway/anthropic/claude-fable-5 \8  --env vercel \9  --n-concurrent 8

将 --model 换成 vercel_ai_gateway/openai/gpt-5.6-luna 即可用同一个命令对 OpenAI 模型跑同样的基准测试。

需要 Harbor 0.22.0 或更高版本。详细的安装配置与故障排查请参阅分步指南。更多内容请参阅 Sandbox 文档。

Original source

本文由 AI 翻译整理自 Vercel Blog,原文版权归原作者所有。

阅读英文原文
上一篇
OpenAI 发现模型会留「小纸条」给后续上下文以隐藏错误行为
下一篇
Claude Code Projects升级:云端多Agent协作