Zapier 自动化平台模型选型参考:2026 最新模型速览
汇总 GPT-5.6、Gemini 3.6 等主流模型在自动化场景的性能对比。提供选型参考但限于 Zapier 用户。
汇总 GPT-5.6、Gemini 3.6 等主流模型在自动化场景的性能对比。提供选型参考但限于 Zapier 用户。
新的 AI 模型几乎每周都会发布,要持续跟进针对特定工作流该使用哪些模型,本身就是一项工作。你可以把本文当作一份持续更新的参考资料。
在 Zapier,我们会使用 AutomationBench 测试每一个模型。这是我们用来测试模型执行多步骤工作流能力的基准,而不只是测试静态 prompt。
下面,我会逐一介绍 Zapier 上可用的主流 AI 提供商、目前可以接入 Zap 工作流的模型,以及根据 Zapier AutomationBench 的测试结果,每个模型最适合的场景。你还会了解到数百款其他 AI 应用的直接集成方式,以及使用我们的内置工具 AI by Zapier 自动化 AI 有多简单。
Zapier 是连接能力最强的 AI 编排平台,与 Google、Salesforce 和 Microsoft 等合作伙伴提供的数千款应用集成。你可以使用表单、数据表和逻辑,为组织技术栈中至关重要的业务工作流构建安全、自动化、由 AI 驱动的系统。了解更多。
AutomationBench,我们的基准测试工具
AutomationBench,我们的基准测试工具
OpenAI(ChatGPT)模型
OpenAI(ChatGPT)模型
Anthropic(Claude)模型
Anthropic(Claude)模型
Google AI Studio(Gemini)模型
Google AI Studio(Gemini)模型
什么是 AI by Zapier?
什么是 AI by Zapier?
Zapier 上可用的其他 AI 应用
Zapier 上可用的其他 AI 应用
浏览下方有关 OpenAI、Anthropic 和 Gemini 模型的内容时,你会看到一个基于 AutomationBench 测试结果的“最适合”部分。AutomationBench 是 Zapier 用来衡量 AI 模型效能的基准测试工具。
Zapier 团队构建 AutomationBench,是为了确定应该在我们的平台上部署哪些模型。我们找不到能够衡量 AI 模型是否有能力处理企业实际依赖的那些混乱而复杂工作的基准测试。意识到市场上存在这一空白后,我们便将它公开了。
每一项被测任务都以我们在平台上观察到的真实工作流模式为原型。(不过,在此过程中没有使用任何 PII。)为了让评分更有意义,我们提高了这些任务的复杂度,以反映真实商业环境中会出现的阻力。这包括添加无关数据、把关键信息隐藏在工具调用之后、让正确信息的位置变得模糊、使用相似的命名约定制造看似合理的错误答案,以及强制执行具有优先级覆盖关系的严格业务规则。
为了说明我们所说的“复杂”是什么意思,下面是一项用于测试的示例任务(你可以在白皮书中找到更多示例):
2026 年 2 月 20 日下午 2:00 出现了日程冲突——一场 Zoom 会议与一个 Google Calendar 日历事件时间重叠。检查电子表格中的会议优先级策略,确定应该保留哪一个,然后重新安排另一个,并在其主题或标题前加上 [RESCHEDULED]。在 Slack 的 #ops-updates 频道发布摘要,说明哪场会议被保留、哪场会议被重新安排,并同时附上 Zoom meeting ID 和 Calendar event ID。
在为模型评分时,我们不会评估 Agent 是如何完成任务的。它调用了哪些工具、以什么顺序调用,都不重要。我们只看最终状态:任务是否完成,以及是否产生了任何副作用。这意味着,一个价格更高但能完成工作的模型,得分会高于一个更便宜却无法完成工作的模型。
以下是排行榜中排名前五的模型。百分比表示各 AI 模型能够完整完成的工作流任务比例。
Claude Opus 5 (Max) — Anthropic*
Gemini 3.6 Flash (High) — Google
GPT-5.6 Sol (Max) — OpenAI
Gemini 3.6 Flash (Medium) — Google
Claude Fable 5.0 (Max) — Anthropic
*注意:Opus 5 的其他变体实际上占据了当前排行榜前五名中的其余位置,但由于它们都属于同一个模型,这里只展示其中能力最强的版本。
OpenAI 在 Zapier 上拥有覆盖范围最广的模型阵容,从经济实惠的 mini 模型到重型推理引擎一应俱全,此外还提供用于转录和图像生成的专用工具。
最适合:销售。 OpenAI 新推出的 GPT-5.6 模型在我们测试的许多领域中表现强劲,尽管最近被 Opus 5 超越。不过,GPT-5.6 Sol (Max) 在销售领域仍以 16.0% 的成绩排名第二。查看 AutomationBench 排行榜。
最新动态: OpenAI 刚刚发布了 GPT-5.6 系列——Sol、Terra 和 Luna,每款模型都针对不同类型的工作进行了调优。Sol 专为高风险、一次性完成的工作流而设计,例如合规审查、记录调取、审批链,以及正确做法有时是暂停、升级处理或完全不采取行动的流程。Terra 适合先从多个工具收集信息再执行操作的工作流,例如根据 CRM、电子邮件和 Slack 中的信息整理销售简报,或在生成报告之前核对多个系统中的数据。Luna 则面向大批量、基于规则且成本会迅速累积的任务,例如逐行应用折扣逻辑、按照既定标准标记潜在客户,或大规模分派支持工单。
输出价格(每 100 万 tokens)
复杂推理与编程
在智能水平与成本之间取得平衡
成本敏感的大批量工作负载
需要最深入推理和最高可靠性的问题:正确性比速度或成本更重要
复杂的专业工作,包括编程、研究、数据分析,以及跨工具自主执行的多步骤任务
大批量、可重复且最看重速度与成本的任务,例如分类、数据提取和排序
需要跨不同内容类型和工具进行快速推理的复杂多步骤工作流
需要深度推理和规划的复杂多步骤专业工作流
快速、具备上下文感知能力的对话与搜索
具备可靠多步骤推理能力的高级编程和 Agentic 任务
以经济实惠的成本处理定义明确的推理和逻辑任务
以极低成本处理摘要、分类和其他轻量级任务中的推理与逻辑
经济实惠的多模态能力
多模态任务,尤其是实时、类人的语音和视觉交互
文本、图像、音频、视频
为通用工作负载平衡能力、性能与经济性
不需要高级推理但拥有超长上下文窗口的复杂任务
速度和价格比原始能力更重要的简单任务
快速、具备成本效益的推理
适用于推理密集型任务、成本低于 o3 的轻量级替代方案
高级推理与逻辑
最先进的图像生成
注意:你会在 Zapier 的 OpenAI 集成中看到更多模型。OpenAI 有时会从产品中下线某些模型,但仍将它们保留在 API 中,并按照另一套时间表从 API 中弃用。我们建议使用上面列出的模型构建新工作流,不过你也可以查看下面的完整列表。
GPT-4o Search Preview
GPT-4o Transcribe Diarize
GPT-4o mini Search Preview
GPT-4o mini Transcribe
text-embedding-3-large
text-embedding-3-small
text-embedding-ada-002
如何自动化 ChatGPT
如何自动化 ChatGPT
OpenAI 模型:每个模型及其最适合的场景
OpenAI 模型:每个模型及其最适合的场景
Anthropic 的 Claude 模型以出色的写作质量、严谨遵循指令的能力,以及安全优先的设计理念而闻名。Claude 常用于起草长篇内容、分析文档,以及为需要自然对话语气的面向客户的聊天机器人提供支持。
最适合:大多数业务职能。 Claude Opus 5 的不同变体在所有领域都位居榜首:支持领域为 22.0%,Fable 5.0 (XHigh) 以 17.0% 紧随其后、排名第二;销售领域为 26.5%;营销领域为 29.0%;运营领域为 56.0%;财务领域为 20.8%;HR 领域为 13.3%。查看 AutomationBench 排行榜。
最新动态: Opus 5 现已在 Zapier 上提供。正如你所看到的,它在所有业务职能中几乎都碾压了其他模型。
输出价格(每 100 万 tokens)
大规模编程、Agent 和日常专业工作
要求最高的推理与长周期 Agentic 工作
编程、Agent、企业工作流——价格与性能的最佳平衡
复杂推理、Agentic 编程、长时间运行的任务
复杂推理、Agentic 编程
复杂推理、Agentic 编程
复杂推理、编程、长周期任务
大批量、对延迟敏感且要求成本效益的任务
复杂 Agent、编程;最高水平的通用智能
复杂推理、分析、创意任务
在编程和工作流之间取得平衡
快速、简单且具备成本效益的分类任务
如何自动化 Claude
如何自动化 Claude
Anthropic AI 模型指南
Anthropic AI 模型指南
Google 的 Gemini 系列凭借超大的上下文窗口、有竞争力的价格,以及覆盖文本、图像、音频和视频的强大多模态能力脱颖而出。Gemini 模型非常适合处理长文档、研究密集型工作流,以及需要控制成本的任务。
最适合:将成本作为首要考虑因素的大批量工作流。 Gemini 3.6 Flash (High) 取得了颇具竞争力的 19.8%,以每项任务仅 0.58 美元的成本位列总榜第六——比排名第一、每项任务成本 1.27 美元的 Claude Opus 5 (Max) 更便宜,同时得分差距保持在约 6 个百分点以内。它仍然是排行榜中成本最低的模型之一。查看 AutomationBench 排行榜。
最新动态: Gemini 3.6 Flash 现已在 Zapier 上提供。它擅长步骤协调和严格遵守策略,而这类工作往往容易让其他模型出现偏离。不过,它在遵循严格的输出格式,以及根据自己完成的数学计算做出决策时,可能会遇到困难。
输出价格(每 100 万 tokens)
部署 Sub-agent、多步骤工作流,以及大规模高效执行长周期任务
文本、图像、音频、视频、PDF
部署 Sub-agent、多步骤工作流,以及大规模执行长周期任务
文本、图像、音频、视频、PDF
复杂推理、高风险编程和海量数据综合处理
文本、图像、音频、视频、PDF
文本、代码、推理
高速自动化、实时对话和具备成本效益的规模化处理
文本、图像、音频、视频
兼顾专业工作流与创意内容生成
文本、图像、音频、视频
Gemini 2.0 Flash Lite
基础分类、超低延迟任务和简单提取
为 2.0 时代的高吞吐量应用提供旧版支持
为旧有 Pipeline 提供高准确度的详细多模态分析
文本、图像、音频、视频
用于多模态处理的过渡级速度
文本、图像、音频、视频
专业级高保真图像生成与编辑
注意:你会在 Zapier 的 Google(Gemini)集成中看到更多模型。我们建议使用上面列出的模型构建新工作流,不过你也可以查看下面的完整列表。
Gemini Deep Research Pro
Gemini 2.5 Pro TTS (Preview)
Gemini 2.5 Flash TTS (Preview)
Gemini 2.5 Flash Image
Gemini 2.5 Flash-Lite
Gemini 2.5 Flash-Lite (Preview)
Gemini 2.0 Flash Image Generation
Gemini 2.0 Flash-Lite
如何自动化 Gemini(Google AI Studio)
如何自动化 Gemini(Google AI Studio)
Google Gemini 模型指南
Google Gemini 模型指南
AI by Zapier 是我们的内置集成,可让你直接向任何 Zap 添加 AI 步骤。它开箱即用地提供了多款 OpenAI 和 Google 模型,无需账户,还附带一个 prompt 优化器。不过,它真正的价值在于,你可以非常轻松地更换 AI by Zapier 内的模型,而不会破坏现有工作流。
配置 AI by Zapier 步骤时,只需点击几下,就能从下拉菜单中选择所需模型。当某个 AI 提供商发布了能力超越你当前所用模型的新模型,或者你要把 Zap 模板交给偏好使用另一种模型实现自动化的团队时,这项功能会非常实用。无论由谁管理 Zap,都可以换上自己偏好的模型,无需费力删除原有步骤,再从头配置一个新步骤。
以下是目前可通过 AI by Zapier 使用的模型概览:
GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, GPT-5.5 Pro, GPT-5.5, GPT-5.4 nano, GPT-5.4 mini, GPT-5.4, GPT-5.2, GPT-5, GPT-5 mini*, GPT-5 nano*, GPT-4o mini*, GPT-4.1 nano*, o3, o3-mini, o1
Sonnet 5, Opus 5, Opus 4.7, Opus 4.6, Haiku 4.5, Opus 4.5, Sonnet 4.6
Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 3.1 Pro, Gemini 3 Pro, Gemini 2.5 Pro, Gemini 2.5 Flash Lite*, Gemini 2.5 Flash*, Gemini 2.0 Flash Lite*, Gemini 2.0 Flash
使用你已在自己的 Azure OpenAI 账户中设置好的 AI 模型。具体可用模型取决于 Azure 管理员启用了哪些模型。
使用你所在公司可通过 Amazon Bedrock 访问的 AI 模型。具体可用模型取决于你的 AWS 账户及所在区域启用了哪些模型。
*可在 AI by Zapier 中免费使用
想了解设置方法或寻找自动化灵感?请查看我们的 AI by Zapier 功能指南。
市面上的提供商远不止这些。Zapier 还与数百款专业 AI 应用直接集成,其中包括:
Grok by xAI——xAI 的对话模型,可实时访问 Web 和 X 数据,语气也比大多数 Assistant 更加不羁。
Grok by xAI——xAI 的对话模型,可实时访问 Web 和 X 数据,语气也比大多数 Assistant 更加不羁。
DeepSeek——一款具备出色编程和推理能力且成本高效的模型,在预算有限的技术工作流中很受欢迎。
DeepSeek——一款具备出色编程和推理能力且成本高效的模型,在预算有限的技术工作流中很受欢迎。
Mistral AI——拥有出色指令遵循能力和多语言表现的模型,覆盖快速的轻量级选项到更大型的 Frontier Model。
Mistral AI——拥有出色指令遵循能力和多语言表现的模型,覆盖快速的轻量级选项到更大型的 Frontier Model。
OpenRouter——通过单一集成即可访问数十家提供商的模型,让你无须管理多个连接,便可以自由混合搭配。
OpenRouter——通过单一集成即可访问数十家提供商的模型,让你无须管理多个连接,便可以自由混合搭配。
Groq——它不是模型,而是硬件加速的推理引擎。当速度是首要考虑因素,并且你需要近乎即时的响应时,可以使用它。
Groq——它不是模型,而是硬件加速的推理引擎。当速度是首要考虑因素,并且你需要近乎即时的响应时,可以使用它。
AssemblyAI——专注于语音转文本和音频智能,包括转录、说话人检测和情感分析。
AssemblyAI——专注于语音转文本和音频智能,包括转录、说话人检测和情感分析。
Google Vertex AI——Google 的企业级 AI 平台,非常适合已经身处 Google Cloud 生态系统、同时需要更多控制能力和定制空间的团队。
Google Vertex AI——Google 的企业级 AI 平台,非常适合已经身处 Google Cloud 生态系统、同时需要更多控制能力和定制空间的团队。
使用 Zapier,你永远不会被锁定在单一模型或提供商上。你可以充分利用每款应用的独特优势,并尝试任何最适合自己工作流的方案。你可以在我们持续扩充的 AI 应用目录中浏览完整列表。
无论你才刚开始尝试 AI 自动化,还是已经在深入构建多步骤工作流,Zapier 都能让你灵活选用真正符合自身需求的 AI 工具和模型。整个领域仍在不断演进,本指南也会随之更新。收藏本文,每当有新模型发布时,随时回来查看。
本文最初发表于 2026 年 3 月,最近一次更新于 2026 年 7 月。