作者梳理当前主流 AI 编程模型的 API 定价、上下文窗口、支持场景和基准测试表现,并给出模型选型的思维框架。
先坦白一件事:这篇文章会很快过时。不是其中的概念——那些是稳定的——而是具体的名称、价格、排名。AI 模型领域的变动速度足够快,任何对比表格都有过期日期。今天用于代码的最佳模型,下个季度可能就退居第二了。现在看起来贵的那个,等你读到这篇文章时可能已经是显而易见的选择。
也就是说:驾驭这个领域的思维模型不会过期。选择模型时要问什么问题、API 访问和订阅有何不同、"上下文窗口"在普通周二实际意味着什么——这些是稳定的。有了正确的地图,你可以在情况变化时自行更新。而它们一定会变。
头部模型是任意时点上最具能力的模型。2026 年的竞争聚焦在三款:
Claude Sonnet 4.6(Anthropic)是贯穿本课程使用的模型,也是代码任务的当前基准。与 Opus 4.7 一起,它以标准定价提供 100 万 token 的上下文窗口——无需特殊 header,无需高级计划。它以持续推理、精准的技术写作和遵循复杂多步骤指令著称。Sonnet 4.6 是速度与质量的平衡;Opus 4.7 更强大,但更慢也更贵。
GPT-5.4(OpenAI)—— 2026 年 3 月发布——是首个具备原生计算机使用能力的通用模型:它可以操作桌面界面并在应用程序间执行复杂工作流。它达到 100 万 token 的上下文,融合了 GPT-5.3-Codex 的编码能力,并提供多种变体——Thinking、Pro、mini(免费层)和 nano(仅 API)——是三者中最容易上手的。近日 GPT-5.5 已发布,在速度和推理方面有所改进。
OpenAI 同样维护着 Codex 系列作为独立产品线:GPT-5.3-Codex 针对复杂的 agentic 软件工程进行了优化,并在 SWE-Bench Pro 等基准上领先;GPT-5.3-Codex-Spark 是其超高速变体,专为实时响应设计。它们并非总是最佳选择——对于通用推理或混合任务,GPT-5.4 覆盖更广——但如果你的用例是密集型 agentic 工程,它们值得了解。
Gemini 3.1 Pro(Google)—— 2026 年 2 月发布——拥有 100 万 token 的上下文窗口,在复杂推理基准上表现出色:ARC-AGI-2 上达到 77.1%,该基准衡量的是解决全新逻辑模式的能力。它的天然优势仍然是 Google 生态集成——Workspace、Cloud、Android、NotebookLM。对于已生活在 Google Cloud 的项目,它难以被忽视。
"哪个最好?"这个问题有一个简单答案和一个诚实答案。简单:Claude。诚实:取决于任务,且每隔几个月就会变化,周五高调发布的基准到下周一认真引用时往往已经过时了。日常使用中,三者之间的实际差异比那些排行榜暗示的要小得多。
还有一个反直觉的现象值得指出:对于日常工作,包装模型的工具比模型本身更重要。直接集成到编辑器中的 Copilot + GPT-4o,可能比没有任何集成的 Claude 更有生产力,即便你在偏好的基准上 Claude 表现更好。下一节会展开更多。
除了头部模型,还有一些专门为开发工作流构建的工具。关键区别:这些不是模型——它们是在底层使用头部模型的接口和助手。
GitHub Copilot——特别是其 Pro+ 计划——是单一环境内模型阵容最广泛的选择。你可以直接在聊天界面中切换 Claude Sonnet 4.6、GPT-5.3-Codex、Gemini 3 Pro 等,无需更换工具。VS Code 和 JetBrains 的集成是市场上最成熟的,具备自主 agent 功能,可以编辑文件、运行终端命令,并在无需手动干预的情况下迭代错误。
它的弱项是上下文:原生限制为 128K token,远低于头部模型的 100 万。Workspace 模式通过 RAG 索引你的代码库来部分弥补,但这与跨长上下文窗口的真正连贯性不同。如果你需要大量代码在飞的长时间会话,Cursor 或 OpenCode 更有优势。如果你重视模型多样性和深度编辑器集成,Copilot Pro+ 难以被超越。
Cursor 是一个完整的编辑器(VS Code 分支),AI 融入编辑流程中。你与它讨论代码,从单一指令出发修改多个文件,并在应用前审查 diff。它比 Copilot 更有主见——不只是补全,而是协作。如果这种工作流对你有效,回头用其他工具感觉像是降级。
OpenCode 是你从本课程第 3 模块开始使用的终端 agent。与 Copilot 或 Cursor 不同,它没有自己的月度订阅——它连接到你选择的任何提供商,既可以通过登录你现有账户,也可以通过提供 API key。OpenCode 负责编排;模型来自你已经签约的提供商。
如果你想不花一分钱就开始,OpenCode 通过其 Zen 服务(仅 CLI)包含 8 个免费模型:主要是国产模型——MiniMax、GLM、Kimi——让你无需信用卡就能探索这个工具。它们在速度、推理和上下文方面有真实局限;它们是起点,不是头部模型的替代品。
另一方面,还有 OpenCode Go,每月 5 美元(首月)然后 10 美元,就能访问精选的高质量国产模型——上述模型的最新版本以及其他——配有相当慷慨的按用量计费限制。对于那些想要比免费 OpenCode Zen 模型更多能力、更长使用时间,但又不想承诺头部模型更昂贵方案的人来说,这是一个中间选项。
当你需要更强能力时,你有几条路:
用提供商账户登录:如果你已有 OpenAI、Google 或其他家的订阅,可以直接从 OpenCode 使用——与从其网页界面或官方应用使用方式相同。
OpenCode Zen(随用随付):token 访问不加价——你只需在提供商价格基础上支付卡片交易费用。
自己的 API key:直接连接到你偏好的提供商。
一个重要例外:Anthropic。它已明确禁止将月度订阅计划(Claude Pro)与 OpenCode 等第三方工具一起使用——仅限 API 访问。这不是 OpenCode 的限制——是 Anthropic 的单方面政策决定,其他提供商也可能效仿;值得一开始就记住。
这两节告诉你的所有内容——最佳模型、价格等——总体上仍然成立,但具体模型名称和价格可能会变。重要的是理解大局:每种模型做什么、API 和订阅的区别、以及如何选择最适合你工作流的工具。
OpenCode 不是唯一的终端 agent。主要 AI 公司都有自己的 CLI 工具,工作方式非常相似——相同的理念,相同的命令行访问:
Claude Code(Anthropic):Anthropic 官方 CLI,已有 VS Code 插件可用,集成度尤其高。
Codex CLI(OpenAI):OpenAI 的终端 agent,专注于密集型软件工程任务。
Copilot CLI(GitHub):GitHub Copilot 的终端扩展。
本课程使用 OpenCode 作为参考,以避免在每个工具上重复示例,但你建立的思维模型同样适用于它们。
对于不想打开独立终端窗口的人:每个代码编辑器都有内置终端。如果你的偏好工具还没有特定插件——或者集成度不如 Claude Code 的 VS Code 插件——从内置终端运行 agent 没有问题。
试着回答"你用哪个 AI 工具写代码?"而不加三十秒的前置说明。这比听起来难——不是因为你不知道,而是因为这些工具之间的边界变动比任何人追踪的都快,而且给定工具使用的底层模型每隔几个月就会悄然变化。真正的问题不是"哪个更好"而是"你希望 AI 在工作流的哪个节点出现"。
访问这些模型有两种方式,它们之间的混淆比你想象的更常见——部分原因是提供商根据上下文用相同的产品名称指代不同的事物。如果这从来没有完全搞清楚过,这不是你知识的缺口;而是行业沟通方式的缺口。
订阅(Claude Pro、ChatGPT Plus、Gemini Advanced)是固定费率访问:固定月费,你可以从提供商的网页界面或应用使用模型,从他们自己的工具(CLI、桌面、编辑器插件)使用,在大多数情况下也可以通过登录账户从 OpenCode 等第三方工具使用。它有用量限制——每天 token 数、每周请求数,取决于提供商——当你达到限额时,访问被切断,直到计数器重置。好处是可预测性:你确切知道这个月要付多少。
API 是编程式的按量付费访问:你获得一个 key,然后从代码或你需要构建的任何集成中调用模型。你为你发送的 token 和接收的 token 付费,不是按时间。速率限制仍然存在——取决于提供商和层级,按分钟或按小时计——但没有固定的月度上限:用得越多,付得越多。成本是可变的,根据用量,它很容易超过订阅的成本。
所以真正的区别不是"基础版 vs 高级版"或"网页用 vs 工具用"——而是可预测的固定成本与可变的、无上限的成本。当你希望用 AI 能力构建自己的应用时,API 是必要的;或者当提供商不允许将订阅与第三方工具一起使用时(Anthropic 的情况,如前所述)。对于其他一切,订阅已经足够。
你需要付费 API 来完成本课程吗?剧透:不需要。早期模块使用网页界面,包含在免费或基础订阅层中。API 是我们到达 OpenCode 时才用到的——而那时,典型学习用法成本比你想象的要低。
每个模型都以其 token 计的上下文窗口做广告。三款头部模型——Claude 4.6、GPT-5.4 和 Gemini 3.1 Pro——现在都达到 100 万。这个数字听起来很可观。
现实检验:上下文窗口是模型在单一对话中能"看到"多少信息——你的消息、对话历史,以及你附加的任何文件或代码。所有这些加在一起。
200K token 听起来很多。实际上,那大约是 15 万个词或约 600KB 的代码。足够粘贴一个中等规模的整个代码库。对于快速回答关于一个函数的问题,2000 token 就足够了。
真正重要的不是最大数字——而是两件事。首先,模型是否在长上下文中保持连贯性(并非所有模型这一点上都同样好)。其次,成本如何随上下文增长,因为在 API 中你也要为输入 token 付费。带有附加大型代码库的长时间对话可能比预期更快地消耗预算。
速率限制是提供商对你每分钟、每小时或每天可以发送多少请求或 token 设置的上限。它们因计划和提供商而异。
对于学习目的,你不会注意到它们。速率限制在以下情况下成为真正的问题:
你在生产环境运行 API,有多个并发用户
你有自动化流程按顺序进行大量调用
你在免费层期间进行密集的工作会话
你达到速率限制的信号通常是 429 Too Many Requests 错误。修复方法:等几分钟或升级你的计划。这不是代码错误——是使用上限。
我不让你纠结了:对于学习来说,成本基本不是问题。大多数模型都有免费层,足以覆盖前几周的使用。Claude.ai 有免费层。ChatGPT 有免费层。基础订阅约为每月 20 美元。
API 是成本变得可变的之处——这种可变性可能在你看到调试会话(比计划更长)一下午后的账单时让你惊讶。定价以每百万 token 多少美元计量。2026 年,Claude Sonnet 约为每百万输入 token 3 美元,每百万输出 token 15 美元。GPT-5.4 在类似区间。
实际上意味着什么?用 OpenCode 的典型工作会话——几个小时附带代码和项目背景的来回——大约在 0.5 美元到 3 美元之间。带有大型代码库和多次迭代的密集会话可能达到 10 美元。对于日常学习使用,月度总额通常在 5 美元到 20 美元之间。
实用建议:从第一天起就在你的 API 账户上设置消费限额。每个提供商都允许你配置这个。不是因为你可能会意外花一大笔钱,而是因为知道有一个上限值得花 30 秒去设置。
有了以上所有信息,真正的问题是:我现在该怎么做?
你不必永久选择其中一个。大多数长期使用这些工具的开发者会根据上下文使用两到三个——网页界面用于快速探索,编辑器工具用于自动补全,终端 agent 用于需要文件访问和命令执行的任务。
你现在有了地图。你知道玩家是谁、模型与其之上构建的工具如何不同、API 何时有意义、以及如何在不让成本成为阻碍的情况下思考成本。下一篇教程我们进入与 AI 的真实对话:如何结构化一个代码 prompt、要包含什么上下文、以及如何在将其提交到项目之前评估响应。