针对AI生成前端代码的专项基准,评估布局渲染、无障碍合规及不同Agent封装的差异。
我们见过太多基准测试图表,上面显示 AI 模型在编程考试中胜过人类开发者。但任何前端工程师都知道,通过一道 LeetCode 算法题和构建一个真正能在浏览器里跑起来的、生产级的 Web Audio Sequencer 或 Dark Analytics Dashboard,完全是两回事。
正因如此,我构建了 OpenVibeEval——一个开源的、社区驱动的基准测试,专门评估 LLM 构建单文件前端界面的能力。
🏗️ 现状问题:标准基准测试不渲染代码
大多数编程基准测试(如 HumanEval)只评估原始 Python 脚本或终端逻辑。它们完全忽略了真实前端的实际状况:
视觉完整性:布局是否真正能渲染出来?CSS 是否会在移动端视口上溢出并导致布局崩坏?
无障碍合规:生成的代码对屏幕阅读器是否可用?是否有有效的语义地标,以及通过 axe-core 自动评分验证的 WCAG 2.1 对比度?
Agent Harness 差异:系统提示词包装器(如 Claude Code、Cline、ZCode、OpenCode)对最终输出有多大的影响?
在 OpenVibeEval,每个模型都会经过标准化的零样本流水线。输出在沙箱化的 iframe 中渲染,并同时接受视觉保真度和无障碍合规性的审计。
🕵️ 0x-Alpha 溯源调查
为了展示这个数据集的能力,我们最近对 0x-Alpha 进行了一次 forensic audit。0x-Alpha 是一个匿名神秘模型,出现在 OpenCode 上。
通过将其前端代码模式和 API 行为与我们 200+ 次运行记录组成的数据库进行比对,我们揭开了它的身世:
44/44 Tokenizer 匹配:完全相同的 token 边界行为。
Error 1210 特征码:与 Zhipu AI API 匹配的基础设施错误码。
结论:0x-Alpha 几乎可以确定是 GLM-5 模型家族的变体。
👉 点击这里阅读完整的溯源报告:OpenVibeEval Model Report
🚀 OpenVibeEval 的核心特性
OpenVibeEval 不只是一张静态的分数表。它是面向开发者的交互式沙箱:
可以把它想象成"前端版的 LMSYS Chatbot Arena"。你并排查看两个渲染好的 UI 构建产物,测试它们的交互效果,然后在模型身份揭晓之前,把"AI SLOP"印章狠狠盖在较弱的那一个上面。
我们最惊人的发现之一:agent harness 的重要性不亚于底层模型。我们见过同一个模型、同一套提示词,仅仅因为换了 harness 包装指令,无障碍分数就从 0% 飙到 98%。
我们数据集中每一次运行记录,都可以在桌面端/移动端实时预览中查看。不再需要去猜测一个抽象的"分数:85"实际上长什么样。
🛠️ 如何参与
我们才刚起步,希望社区一起来绘制 AI 前端领域的全景图:
🥊 在竞技场投票:帮我们达到 30 票的门槛,解锁每个提示词的社区胜率排行榜。
⚙️ 提交 Harness:如果你有一个自定义的系统提示词或 agent 包装器,能让模型输出更干净的 Tailwind 或 React 代码?提交给基准测试!
🔍 审计数据:所有评估运行记录和方法论公式 100% 开放透明。
查看排行榜并投下一票 ➔

如需进一步行动,你可以考虑屏蔽此人或举报滥用行为