Supabase 开源了基准测试框架,用真实任务(数据库 Schema、Edge Functions、RLS 策略等)评估 Claude Code、Codex 等 AI 编程工具,提供客观对比数据。
Supabase 已经开源了 Supabase Evals,这是一个用于测试 AI 代理在使用 Supabase 时构建能力的基准和框架。它针对真实任务(如构建数据库模式、调试失败的 Edge Function 或修复损坏的 RLS 策略)运行包括 Claude Code、Codex 和 OpenCode 在内的编码代理,然后对结果进行评分。它支持 supabase.com/evals 上的公开排行榜和每天监控的内部回归测试套件。
是的,从今天开始。supabase/evals 在 Apache-2.0 许可下公开,可以通过 pnpm 本地运行。
开发者工具、云基础设施、数据平台,以及金融科技或医疗保健中的受监管后端,其中代理编写错误的 RLS 策略是一个安全事件。
回归测试文档和技能编辑、门控 SDK 发布,以及代理框架的并排比较。
本地栈运行需要 Docker 守护进程、提供商 API 密钥,以及 54321–54329 端口空闲。
Supabase 定义了三个维度:产品(database、auth、storage、edge-functions、realtime、cron、queues、vectors、data-api)、主题(RLS、security、migrations、SQL、SDK、observability、self-hosting、tests、declarative-schema)和阶段(build、deploy、investigate、resolve)。然后它选择了触及每个维度一次的最小场景集合,基于支持工单、bug 报告和 GitHub 问题。
场景分为两个套件。基准场景涵盖广度并已发布。回归场景涵盖已知故障模式,每天刷新,不会改变已发布的分数。
每个场景都针对真实环境运行。框架在容器中启动类似托管的栈和本地 CLI 项目,因此代理调用实际的 MCP 服务器和 CLI。平台轻量级运行时暴露由 @supabase/lite 支持的管理 API 兼容的接口。评分结合了确定性检查和 LLM 作为判官。代理在评分前获得一次重试。
每个 eval 目录包含 PROMPT.md(任务加前置元数据)、EVAL.ts(评分器)和可选的 remote/ 和 local/ 初始状态。提交 local/ 工作区或声明 interface: cli 会使用安装了真实 CLI 的 Docker 沙盒启动。
代理在不加载任何技能的情况下通过大多数场景。在构建阶段,Opus 5 和 Kimi K3 都独立获得了 100% 的分数。技能弥补了其余差距:Sonnet 5 从 78% 上升到 100%,GPT-5.6 Sol 从 89% 上升到 100%,GPT-5.4 mini 从 78% 上升到 89%。
浮现出三个弱点。代理手工编写迁移而不是使用声明式模式,促使更新了技能指导。代理手工验证身份验证而不是使用 @supabase/server,促使提供了包选择指南。文档使用差异很大:Codex / GPT-5.6 每个场景大约阅读 8 页文档,而 Claude Code 只需约 2 页,甚至在加载技能的情况下,也仅在不到 40% 的场景中查看文档。
Supabase 在 Apache-2.0 下开源了 supabase/evals。
场景针对真实的容器化 Supabase 栈运行,而不是模拟。
评分将确定性检查与 LLM 作为判官相结合;允许一次重试。
技能对顶级模型的影响最小,对较小模型的影响最大。
查看技术细节和 GitHub 仓库。同时,欢迎在 Twitter 上关注我们,别忘了加入我们的 150k+ ML SubReddit 和订阅我们的新闻通讯。等等!你在 Telegram 上吗?现在你也可以在 Telegram 上加入我们。
需要与我们合作推广你的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会等?联系我们
Michal Sutter 是一位数据科学专业人士,拥有帕多瓦大学数据科学硕士学位。具有统计分析、机器学习和数据工程的扎实基础,Michal 擅长将复杂数据集转化为可行的见解。