从聊天机器人演变为通用AI平台,ChatGPT现已整合搜索、图像生成、代码编写、跨应用自动化;文章系统解析其底层机制和发展脉络。
ChatGPT 最初是 OpenAI 大语言模型(LLM)的一个聊天机器人和技术演示。如今它更接近于一个通用 AI 平台——可以搜索网页、生成图片、写代码、推理复杂问题,以及在各种应用间执行多步骤操作。
随着 OpenAI 不断用新模型和新功能推动 ChatGPT 向前发展,一个看似简单的问题变得出奇地难回答:ChatGPT 是如何工作的?
好吧,我来尽力回答。
本文涵盖驱动 ChatGPT 的核心技术原理。如果你在找教程,了解更多关于如何使用 ChatGPT。
GPT 代表 Generative Pre-trained Transformer(生成式预训练变换器)——这是驱动最初底层 AI 模型的架构。OpenAI 之后发布了多个模型系列,但底层发生的很多事情在所有模型中保持一致。
ChatGPT 自动将每个请求路由到最适合处理它的模型(或模型组合)。除非你在模型选择器中自己选了一个,否则它会替你选择。
当你向 ChatGPT 发送一条提示词(prompt)时,实际发生的事如下(继续往下读会有更深入的解释):
ChatGPT 将文本分解成 token。 ChatGPT 将文本分解成 token。
将 token 通过其基于 Transformer 的网络运行,以识别最重要的内容。 将 token 通过其基于 Transformer 的网络运行,以识别最重要的内容。
生成最能契合你请求的输出 token 序列——结合其训练数据、微调结果,以及少量随机性。 生成最能契合你请求的输出 token 序列——结合其训练数据、微调结果,以及少量随机性。
让我们更深入地了解其中一些术语。(乍一看它们可能比较零散,但彼此都是关联的。)
开发 AI 模型的一个关键部分叫做"训练"。GPT 中的 P 代表"预训练"(Pre-trained),这是这些模型能力的基础。
早期的 AI 模型使用监督学习:在人工标注的数据上进行训练,比如一个动物照片数据库配以人类撰写的描述。有效,但代价昂贵且规模受限。世界上根本没有足够的标注数据来训练一个涵盖人类全部知识的模型。
GPT 模型采用了不同的方法:无监督学习(生成式预训练):给模型几个基本规则,指向开放的互联网,让它自己发展对语言运作方式的理解——在每一步都不需要标签或人类指导。随着 OpenAI 在每个 successive 模型系列中扩大这一过程,他们可以纳入更多数据和更多模态。最近的模型是多模态的,同时在文本、图片和音频上训练,因此它们不仅能学习苹果是什么,还能学习它看起来是什么样。
无监督学习正因为其规模而强大,但本质上不可预测,因此每个模型也会经过"微调"以使其行为更可预测、更恰当。微调通常使用监督学习的某种形式,只是选择在模型已经形成对世界的广泛理解之后 selective 应用。
Transformer 架构是一种神经网络设计,允许像 ChatGPT 这样的 AI 模型理解和生成人类语言。它是 GPT 中的 T,最早在 2017 年的一篇研究论文中提出,是当前 AI 繁荣的基础性突破。
在 Transformer 出现之前,AI 模型使用循环神经网络(RNN),按顺序读取文本——当含义取决于句子中相距很远的词语时,这是一个缓慢且不可靠的过程。
Transformer 通过一种叫做自注意力(self-attention)的机制解决了这两个问题:模型同时读取整个句子,并将每个词与所有其他词进行权衡,将其注意力引导到最相关的内容上,而不管位置如何。(Transformer 实际上并不处理词语——它们处理的是 token。但稍后会详细说明。)
因为这一切是并行发生而非逐字进行,它也大幅削减了训练时间和成本,这是 2017 年之后 AI 开发如此急剧加速的重要原因之一。
Token 是文本的一小块(平均约四个字符)——这是 AI 模型理解文本的方式。许多常用词映射为单个 token;较长或更复杂的词会拆分成多个。同一原则也适用于图片和音频,它们在模型处理之前也会被打散成 token。
早期模型在几乎完全来自人类撰写的文本上训练——书籍、文章,以及大规模爬取的开放互联网数据——使用的 token 数量达到数千亿。最近的模型训练的 token 数量显著更多,而且越来越多地包含合成(AI 生成的)数据,因为人类创造的内容已成为一种限制性约束。
所有这些训练产生了一个拥有数十亿参数的神经网络——参数是决定模型如何权衡输入以生成响应的变量。早期模型约有 1750 亿个参数。更新一代的模型肯定更多,尽管 OpenAI 不再公布具体数字。值得关注的是:更多参数并不自动意味着更好的模型。架构改进和更好的训练数据同样重要——有时甚至更重要。
对话历史中的 token、你分享的任何文档,以及模型的自身响应,加起来会消耗所谓的上下文窗口(context window)(这是模型一次能处理的信息总量)。现代模型支持非常大的上下文窗口,达到数百万级别,但在冗长或复杂的对话中,该限制内被优先处理的内容会影响响应质量。
一个几乎没有任何 guardrails 地在开放互联网上训练的模型,不适合向公众发布(想象一下那会有多可怕)。
因此,为了进一步优化模型以各种不同提示词进行安全、合理、有效且连贯的响应,他们使用一种叫做基于人类反馈的强化学习(RLHF)的技术进行优化。
这个过程分两步工作:首先,人类训练员向模型展示良好响应的示例。然后,他们将竞争性输出从最佳到最差排序,用于构建一个奖励模型——一个 AI 学会优化的评分系统。随着时间推移,这引导模型远离有害或有偏见的响应,朝向有帮助的、连贯的响应。
RLHF 还允许每一代模型都比上一代更安全、更可靠——随着技术改进,模型行为也随之改善。
标准 LLM 默认给出最可能的答案,这对日常任务效果很好,但在需要多个步骤的问题上会失效。让一个标准 LLM 解决一个高级逻辑谜题或另一种多步骤问题,它可能会答错。
思维链(Chain-of-thought,CoT)推理解决了这个问题。CoT 扩展了强化学习,训练模型在回答之前先思考。CoT 训练的模型不会跳到第一个看似合理的答案,而是将问题分解成几个部分,逐步处理每个步骤,并在得出结论之前测试替代路径——更像一个人推理问题的方式,而不是系统 pattern-matching 到一个可能的输出。
权衡的是计算时间:CoT 需要更长时间和更高成本,因此 ChatGPT 只在这种提示词真正需要时才将请求路由到这些模型。
所有这些努力都为一个目标服务:让 OpenAI 的模型在自然语言处理(NLP)方面尽可能有效。NLP 是 AI 的一个分支,专注于教机器理解和生成人类语言,涵盖从语音识别和翻译到聊天机器人的一切。
例如,当我给 ChatGPT 这个提示词:"The moon is made of…"(月亮是由……构成的),它回复了:
当我再次给出相同的提示词,它说:
"…rock. More specifically, mostly silicate rock, with a small iron-rich metallic core."
(……岩石。更具体地说,主要是硅酸盐岩石,带有一个小的富铁金属核。)
相同的提示词,但答案非常不同——因为模型并不是在检索缓存的响应。它在权衡训练期间学到的所有内容的概率,每次生成新的输出,并内置了少量随机性。第一个回复倾向于明显的笑话,而第二个直接追求地质准确性。两者都是合理的补全。
你可以通过调整 temperature 来影响随机性对输出的影响程度,这是大多数 LLM API 中的标准设置。如果你直接使用 OpenAI 的模型进行开发,OpenAI API 让你可以访问该 temperature 设置。调高它,响应变得更加多样化和有创意;调低它,响应变得更加可预测和一致。
ChatGPT 不仅限于文本。它也是多模态的。这意味着它可以理解和响应文本、图片和音频(以及许多其他输入),作为同一提示词的一部分。
在实践中,这就是它能够分析照片、解析图表、转录语音或进行实时语音对话的原因——所有这些都无需切换模式或工具。你可以将一张图片放入编写代码或提问的同一聊天窗口,ChatGPT 将其视为一个统一的提示词。
输入看起来不同,但底层机制基本相同:所有内容都被 token 化,通过 Transformer 网络运行,并一起处理。
ChatGPT 已经远远超越了最初的聊天界面。以下是如今一些最强大的使用方式:
ChatGPT 桌面应用。网页应用允许你在聊天和工作(以前的 ChatGPT Agent)之间切换,桌面应用则增加了另一种模式:Codex。这意味着你可以进行对话、完成更长的研究任务,以及编写或审查代码,而无需切换工具。桌面应用还可以查看屏幕内容并与本地文件及桌面应用配合工作(需要你的许可)。
ChatGPT Voice。这在网页和移动端都可使用,让你以你正在想象的那种反乌托邦式 Her 未来的方式与 ChatGPT 进行实时对话。
ChatGPT 记忆。如果你允许,ChatGPT 可以自动记住你跨对话的偏好和上下文。对于更刻意的定制,你可以构建一个针对特定任务或工作流调整的自定义 GPT。
ChatGPT 工具。ChatGPT 可以搜索网页、运行代码、分析数据,并在其他应用间执行操作——通常无需你明确要求。
ChatGPT 集成。ChatGPT 连接器允许你连接到外部工具和数据源,因此它可以搜索记录、以你的名义执行操作,并在提示时跨连接的应用运行工作流。它还与 Zapier 集成,因此你可以连接到数千个更多的应用。
基于过去一年的更新和发布热潮,OpenAI 显然在推动 ChatGPT 朝一个方向前进:更少的问答,更多的行动。OpenAI 的模型正越来越多地被设计为跨工具和软件自主行动,只需最少的人类输入——随之而来的是持续的工作,以确保它们行为可靠且安全。
OpenAI 相当公开地谈论着让模型行为正确的挑战——回滚未能达标的更新,发布概述其模型应该如何行为的模型规范,并总体上努力跟上问题——而这些问题只有在数亿人开始使用它之后才会显现。这是一项持续进行的工作,而且可能永远都是。
随着 ChatGPT 承担更多 agent 性质的任务——代表你在应用和系统间行动——围绕模型行为、访问控制和可靠性的 stakes 只会变得更加重要。OpenAI 显然意识到了这一点。能力发展的速度是否会在使其值得信赖的努力之前保持领先,是值得关注的问题。
ChatGPT 作为 AI 助手无疑非常出色。问题在于它实际做事所需的一切访问——而且它做得越多,控制它可以访问什么以及保持该访问安全就变得越重要。
Zapier 就是为这一点而构建的。每个连接都通过 Zapier 的治理基础设施运行:你的凭证永远不会接触模型,而你决定 AI 可以精确访问哪些应用和操作。
将 Zapier MCP 安装到 ChatGPT,你可以要求 ChatGPT 跨 9000+ 个应用执行操作——例如,它可以从你的 CRM 提取数据或更新电子表格——所有这些都无需离开聊天窗口。
Zapier 是连接最紧密的 AI 编排平台——与 Google、Salesforce 和 Microsoft 等合作伙伴的数千个应用集成。使用表单、数据表和逻辑来构建安全、自动化的 AI 驱动的系统,为你业务关键工作流跨你组织的技术栈提供服务。
本文最初发表于 2023 年 2 月。最近一次更新(由 Jessica Lau 贡献)是在 2026 年 8 月。