前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8394
  • 幂等性:让发布 Agent 不怕中途被杀
  • AI Agent 安全:教程里不会教的防护层
  • 2026生产级AI Agent实战指南:评估体系、生产架构与竞争策略
  • 企业级多Agent架构设计:Agent Mesh实现跨框架互操作
  • 上下文工程:6 文件替代全量历史,Token 消耗降 84%、准确率升 39%
  • AI 编码 Agent 需要确定性验收边界
  • 批处理中的静默失败:十条日志全成功仅两条执行
  • Pest 5:用测试工作流重新定义 Agent 代码验证
  • AI Agent的记忆检索正常却答错了:信息过期的隐性陷阱
  • AI编程的质量瓶颈在于上下文,而非模型本身
  • 自进化AI Agent正在淘汰静态脚手架:2026技术架构解析
  • AMD收购Taalas:芯片级AI推理的时代来了
  • Embabel:JVM上的Spring之父新作,Kotlin编写的企业级Agent框架
  • 6000+评论揭示:Cursor是AI编程安全问题最多的工具
  • 2026年AI编程工具横评:9款主流Harness对比与模型选配指南
  • LTX-2:首个DiT架构音视频生成模型开源
  • 33个生产Agent运行经验:记忆持久化模式总结
  • VLM+DOM Diff实现低误报的UI回归测试
  • 新模型来了?先用自己仓库的历史 commit 跑一遍
  • 廉价新模型上线前,我用 2 小时金丝雀测试决定要不要切
  • 免费模型评测后再付费:AI 编程任务的评估工作流
  • Meta 30B本地Agent模型Mac实测对比
  • 用测试套件自动分流免费/付费模型的工作流
  • Switchyard:Rust 编写的 LLM 流量代理,支持 OpenAI/Anthropic 协议互转
  • RAGFlow v0.4:开源 RAG 引擎支持 DeepSeek v4 与多渠道聊天
  • 廉价模型优先、失败时升级:构建可审计的双层 LLM 流水线
  • Vercel实习生直参生产:CDN、v0、AI Gateway实战复盘
  • DeepSeek-V4-Pro 正式版:Agent 能力大幅提升,支持三档思考强度
  • 2026年Claude Code最佳替代工具横评
  • DeepSeek-V4-Pro 正式版发布:Agent 能力大幅提升,支持 Responses API
  • AI编程工具选型:别比补全速度,比执行位置
  • AI代码审查风险分级路由:用强模型只审高危diff
  • DeepSeek V4 Pro正式版发布,多项对标Fable 5
  • 把AI Agent的模型路由策略放进Git:账单降了代码才动
  • 成本感知AI路由策略:按任务难度自动选免费或最强模型
  • 两周路由日志:终结选AI模型的玄学决策
  • 我用自己git历史评估每代新编程模型
  • LiteLLM供应链投毒致全球2500企业195TB数据泄露,含大量CI/CD密钥
  • AI编程的真正陷阱:需求描述不完整比代码Bug更危险
  • 自建LLM路由:用任务分类器把每类任务分配给最便宜模型
  • 本地演练LLM降级链路:别等故障时才暴露问题
  • 升级率作为不变式:别让廉价模型把贵价配额烧光
  • AI Agent 经济雏形:任务市场与自主协作
  • 60行纯Python实现多模型路由交换机
  • 别测最终答案:轨迹评估才是 Agent 质量真相
  • DeepSeek-V4-Pro 实测:非基准测试的业务场景表现
  • AI分析Agent应内置覆盖率账本,避免隐藏的 scope 扩展
  • 大 MCP 工具注册表如何避免撑爆 LLM 上下文
  • AI证明可验证了:OpenAI开源Lean 4形式化验证工作流
  • 150行Python手写AI Agent,无LangChain依赖
  • 免费编程模型的可重复烟雾测试方法
  • 已加载 51 / 8394
8.0
热点
AI SCORE
编程提效2026-08-13 12:12

免费模型评测后再付费:AI 编程任务的评估工作流

dev.to · AI#AI编程#Prompt工程#成本优化
Editor brief · 编辑速览

建议先用免费模型建立个人 benchmark(5 个真实任务),对免费模型失败的任务再路由到付费前沿模型,避免为简单问题付出不必要的高昂推理成本。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

我在团队聊天中经常看到这样一种模式:有人遇到了一个令人沮丧的 bug,把问题粘贴到他们能访问的最贵的模型里,得到了一个普普通通的答案,然后得出结论"AI 编程工具不好用"。问题通常不在模型本身。而是整个过程根本没有评估环节——没有基线任务、没有对比、没有弄清楚哪类问题才真正需要一个前沿模型。

这篇文章是一套解决这个问题的 workflow。核心理念:在把真正的工作交给付费推理之前,先从你的代码库里构建一个小型的个人基准测试,先在免费模型上跑一遍,只把那些在免费层确实失败的任务升级到付费模型。对于很多团队来说,这只是少数任务。

第一步:从你自己的仓库构建五个任务的基准测试

通用基准测试(HumanEval 风格)对你日常工作几乎毫无参考价值。代わりに,从你过去两周的工作中抽取五个任务:

一个你已经解决的真实 bug(你知道正确答案——这才是关键)。

一个在时间压力下完成的重构任务。

一个为有边界情况的函数编写测试的任务。

一个"解释这段代码"的任务,针对一个令人困惑的遗留模块。

一个acceptance criterion清晰的小功能。

把每个任务写成一个自包含的 prompt,并把相关代码粘贴进去。把它们放在一个文件夹里。这需要花费一个小时,但回报是立竿见影的。

第二步:先在免费模型上跑基准测试

披露:本文是作为 MonkeyCode 产品推广的一部分准备的。我在这里用它作为示例,因为它的免费模型访问和免费服务器选项直接映射到这个 workflow——你可以在无需Billing决策的情况下运行基准测试,并且把对比测试框架托管在免费服务器层上,而不是本地。这个 workflow 本身适用于任何提供免费模型访问的供应商;只需更换端点和 auth 配置,其他不变。

先跑免费模型的重点不是省钱表演。是测量卫生:如果一个免费模型解决了任务,你就不需要为那个任务类别付费。如果它失败了,你就有了一个具体的失败案例可以交给付费模型——这也让付费模型的输出更容易判断。

第三步:用评分表打分,而不是凭感觉

对每个任务,从三个维度打分,0-2 量表:

正确性(0 = 错误,1 = 思路对但代码有bug,2 = 可运行)

局部性(0 = 重写了无关代码,1 = 改动超出必要范围,2 = diff 最小)

解释质量(0 = 自信的胡说八道,1 = 含糊,2 = 你能学到东西)

一个免费模型在五个任务中得到 10-12/30 分仍然有用——在它得 2 分的那些任务上。那就是你的路由表。

产物:一个可复现的对比测试框架

下面是一个极简脚本(提案/伪代码级别——请根据你的供应商适配端点和认证),它把你的基准测试文件夹跑一个模型并记录结构化结果:

#!/usr/bin/env python3
"""Run a folder of task prompts against an LLM endpoint and log scores.
Usage: MODEL=<model-id> python bench.py ./tasks/
Fill in ENDPOINT and scoring after manual review of outputs.
"""
import json, os, sys, time
from pathlib import Path
import urllib.request

ENDPOINT = "https://your-provider.example/v1/chat/completions"  # replace
API_KEY = os.environ.get("PROVIDER_API_KEY", "")
MODEL = os.environ["MODEL"]

def run_task(prompt: str) -> str:
    body = json.dumps({
        "model": MODEL,
        "messages": [{"role": "user", "content": prompt}],
        "temperature": 0.2,  # keep it low; you want comparability, not creativity
    }).encode()
    req = urllib.request.Request(
        ENDPOINT, data=body,
        headers={"Content-Type": "application/json",
                 "Authorization": f"Bearer {API_KEY}"})
    with urllib.request.urlopen(req, timeout=120) as r:
        return json.loads(r.read())["choices"][0]["message"]["content"]

def main(task_dir: str):
    results = []
    for task_file in sorted(Path(task_dir).glob("*.md")):
        prompt = task_file.read_text()
        t0 = time.time()
        output = run_task(prompt)
        results.append({
            "task": task_file.name,
            "model": MODEL,
            "latency_s": round(time.time() - t0, 2),
            "output": output,
            "scores": {"correctness": None, "locality": None, "explanation": None},
        })
    out = f"results_{MODEL.replace('/', '_')}.json"
    Path(out).write_text(json.dumps(results, indent=2))
    print(f"wrote {out} — now review outputs and fill in scores")

if __name__ == "__main__":
    main(sys.argv[1] if len(sys.argv) > 1 else "./tasks")

值得注意的刻意选择:

temperature: 0.2——你在对比模型,所以要降低方差。如果想要一个粗糙的稳定性检查,每个任务跑两次。

分数由人工填写,不是自动评分。在这个阶段用另一个 LLM 自动评分代码任务只是把不确定性转移了一下。对于五个任务,人工审查需要二十分钟。

记录 latency 是因为一个慢但免费的模型会改变交互使用 vs 批量作业的考量。

把这个托管在免费服务器层(而不是本地)很重要,如果你希望团队成员能重新跑相同的基准测试,或者你想让它按计划运行以检测模型行为随时间的变化。

路由:决策表

跑过一次基准测试后,你可以构建一个这样的路由表(你的肯定不一样——这就是重点):

在大多数版本的这个练习中,一个有趣的发现:那些让你觉得需要最好模型的任务("这个 bug 很棘手")和那些真正需要的任务("修复需要跨四个文件推理")之间的重叠比直觉想象的要少。

局限性和谁不应该这样做

五个任务是感觉检查,不是统计数据。把结果当作路由提示,而不是值得发表的基准测试。在用它做预算决策之前先扩大任务集。

免费层级会变化。任何免费提供的模型阵容、限制和可用性都会随时间变化。不要把模型名称硬编码到你的路由里;当阵容变化时重新跑基准测试。在依赖它之前,先验证供应商自身文档中当前可用的内容。

不要在未经安全政策负责人批准的情况下,把专有代码粘贴到任何第三方端点——免费的或付费的。使用合成的问题复现而不是真实 bug。

如果你的工作已经被一种任务类别主导,而你已知道它需要前沿推理(例如,大规模架构迁移规划),完全可以跳过这个。如果答案已知,基准测试的开销就不值得。

如果你无法对任务类别的模型输出进行competent审查,也完全跳过。基于无法验证的评分构建的路由表比没有路由表更糟糕。

使用昂贵模型的习惯不是工具问题,是缺少评估的问题。花一个小时构建基准测试,然后用免费层级来跑它,把"我应该用哪个模型?"这个反复争论的问题变成一张每月更新一次的表。如果你想找一个低摩擦的地方尝试这个,MonkeyCode 的免费模型访问和免费服务器选项覆盖了设置的两半——但这个 workflow 本身可以独立运作,无论你已经在用哪家供应商。

你的路由表长什么样?如果你也跑过类似的,我很好奇哪些任务类别让你意外。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
廉价新模型上线前,我用 2 小时金丝雀测试决定要不要切
下一篇
Meta 30B本地Agent模型Mac实测对比