OpenAI 核心工程师详解如何将 ChatGPT 扩展到 1000 万用户,涵盖 Sites、Memory、Subagents 等关键功能模块的设计思路。对构建 AI 产品和 Agent 应用的开发者有重要参考价值。
使用代码的人数,大约是会编写代码的人数的 100 倍。1 随着生成“开箱即用”代码变得越来越容易,这一群体或许才是最大的机会所在——前提是你能把智能体交互界面做好。
我们在 AINews 持续关注的一个关键趋势,是今年 Codex 使用量的爆发式增长,其月活跃用户数如今已较 2026 年 1 月增长超过 10 倍。在 7 月 9 日发布后的不到两周内,OpenAI 表示 ChatGPT Work 和 Codex 的合计用户数已达到 1000 万(正如我们在播客中讨论的,Codex 现在为 ChatGPT Work 提供底层能力,因此所有 ChatGPT Work 用户如今也都是 Codex 智能体运行框架的用户,即便他们并非传统意义上的工程师)——这展现了从编程智能体迈向知识工作智能体之后,一切才刚刚开始:
我们今年一直在强调,编程智能体正在“突破边界”,开始承担其他各种任务,为知识工作的各个环节提供支持——而这一变化首先体现在组织架构上。上个月的一次重大重组中,Codex 最重要的两位领导者 Greg 和 Tibo 分别开始负责产品以及 ChatGPT,从而完成了最早于 3 月讨论的“超级应用”整合周期。
经过这些更新,Codex 已经不再只是一款编程工具。OpenAI 在 6 月表示,知识工作者已经占到 Codex 用户群体的大约 20%,而且其增长速度是开发者的 3 倍以上。一个专门面向知识工作者的产品,正从 Codex 团队中孕育出来。
不过,知识工作所面对的问题和环境与编程不同。几十年来,知识工作一直分散在各种不同的基本载体之中:使用文档进行写作,使用电子表格进行分析,使用幻灯片进行沟通,其余工作则依赖各种专业应用程序。如今,ChatGPT Work 让用户能够借助智能体跨越所有这些载体开展工作。用户不再需要打开某个应用程序并手动操作其中的功能,而是可以描述想要的结果,然后与智能体协作,由智能体组合实现目标所需的工具、上下文和产物。
从在 Airtable 构建无代码产品,到领导 OpenAI 的生产力工程团队,Akshay Nathan 职业生涯中的很大一部分时间,都在努力让不会编写代码的人也能获得软件的力量。在本期节目中,Akshay 与 swyx 和 Vibhu 一起深入解析 ChatGPT Work 的发布、Codex 为何出人意料地在 OpenAI 内部的非开发者群体中迅速流行,以及该公司更宏大的计划:先让软件工程师用上实用的智能体,再将其带给知识工作者,最终惠及每一个人。
我们深入探讨了 Codex 与 ChatGPT Work 共用的智能体运行框架、OpenAI 为什么将两种体验整合到一起却又没有让它们完全相同,以及持久化计算机、产物、Sites、插件、记忆和子智能体正在如何改变人们可以委托给 AI 的工作。Akshay 解释了为什么一些团队正在用交互式网站取代幻灯片和电子表格,智能体如何跨越代码、Slack、文档和本地文件收集上下文,以及 OpenAI 从 OpenClaw 等个人智能体产品中学到了什么。
顺带一提:也不要错过 Abhihek 在 AIE 上关于沙箱技术分会场的主题演讲。如今,ChatGPT Work 的许多沙箱能力正是由这项技术提供支持……没错,在最近的 HuggingFace 事件中,一个尚未发布的 OpenAI 模型也攻破了它。
Akshay 还谈到了 AI 如何改变产品开发本身:为什么越来越多的人会成为拥有一项专长的通才;当几乎所有人都能构建产品时,为什么想法和品味会成为瓶颈;为什么 LLM 仍然难以产生真正有现实依据的新想法;以及团队为什么必须区分活动量的增加与真正的进展。
为什么 Codex 出人意料地在 OpenAI 内部的非开发者群体中迅速流行
为什么 Codex 出人意料地在 OpenAI 内部的非开发者群体中迅速流行
为什么员工觉得使用 Codex 让他们获得了一种新的超能力
为什么员工觉得使用 Codex 让他们获得了一种新的超能力
促使 OpenAI 构建 ChatGPT Work 的产品洞察
促使 OpenAI 构建 ChatGPT Work 的产品洞察
为什么 Codex 和 ChatGPT Work 共用同一个底层智能体运行框架
为什么 Codex 和 ChatGPT Work 共用同一个底层智能体运行框架
两者在用户体验、Git 可见性、产物和沙箱默认设置方面有何不同
两者在用户体验、Git 可见性、产物和沙箱默认设置方面有何不同
为什么 OpenAI 选择合并智能体体验,而不是构建彼此独立的产品
为什么 OpenAI 选择合并智能体体验,而不是构建彼此独立的产品
AI 如何模糊工程、设计、战略和运营之间的界限
AI 如何模糊工程、设计、战略和运营之间的界限
为什么 OpenAI 希望默认模型配置能够满足大多数用户的需求
为什么 OpenAI 希望默认模型配置能够满足大多数用户的需求
高级用户应该在什么时候使用更深层次的推理、Ultra 或多智能体模式
高级用户应该在什么时候使用更深层次的推理、Ultra 或多智能体模式
产物、智能体式电子表格,以及如何创建高保真的工作成果
产物、智能体式电子表格,以及如何创建高保真的工作成果
为什么交互式 Sites 可能会取代幻灯片和电子表格
为什么交互式 Sites 可能会取代幻灯片和电子表格
为一个几乎什么都能构建的智能体设计简单界面所面临的挑战为什么用户应该重新尝试那些模型在三个月或六个月前还无法完成的任务
为一个几乎什么都能构建的智能体设计简单界面所面临的挑战为什么用户应该重新尝试那些模型在三个月或六个月前还无法完成的任务
AI 如何在不取代人类判断的前提下,为绩效评估收集上下文
AI 如何在不取代人类判断的前提下,为绩效评估收集上下文
OpenAI 如何通过自动化,将内部 Slack 和文档活动转化成网络迷因
OpenAI 如何通过自动化,将内部 Slack 和文档活动转化成网络迷因
ChatGPT Work 和 Codex 达到 1000 万用户对产品意味着什么
ChatGPT Work 和 Codex 达到 1000 万用户对产品意味着什么
OpenClaw 如何启发持久化环境、定时任务和个人智能体
OpenClaw 如何启发持久化环境、定时任务和个人智能体
使用 ChatGPT 进行财务规划、预算管理、健身、膳食安排和家庭事务管理
使用 ChatGPT 进行财务规划、预算管理、健身、膳食安排和家庭事务管理
子智能体背后的设计权衡,以及应该向用户展示多少子智能体的工作过程
子智能体背后的设计权衡,以及应该向用户展示多少子智能体的工作过程
ChatGPT 记忆、Chronicle 与长期上下文
ChatGPT 记忆、Chronicle 与长期上下文
为什么 AI 可能会让更多人成为具有深厚专长的通才
为什么 AI 可能会让更多人成为具有深厚专长的通才
当几乎所有人都能构建产品时,为什么想法和品味会变得更加重要
当几乎所有人都能构建产品时,为什么想法和品味会变得更加重要
为什么 LLM 仍然难以完成“给我带来新想法”这一指令
为什么 LLM 仍然难以完成“给我带来新想法”这一指令
为什么应该通过高质量的出手机会来衡量生产力,而不是提交次数、token 数量或拉取请求数量
为什么应该通过高质量的出手机会来衡量生产力,而不是提交次数、token 数量或拉取请求数量
AI 生成的活动量与有意义的进展之间的关键区别
AI 生成的活动量与有意义的进展之间的关键区别
00:00:00 开场与让每个人都能获得代码的力量
00:01:33 加入 OpenAI,并保留创业公司文化
00:02:40 OpenAI 从企业采用 AI 的过程中学到了什么
00:05:28 OpenAI 为什么构建 ChatGPT Work
00:07:17 Codex 与 ChatGPT Work,以及二者共用的智能体运行框架
00:12:07 OpenAI 为什么合并智能体体验
00:16:24 模型、推理级别与如何选择合适的默认设置
00:20:26 产物、智能体式电子表格与模型—产品协作
00:24:22 Sites 为什么可能取代幻灯片和电子表格
00:30:08 设计一个几乎什么都能构建的智能体
00:34:28 从开发者智能体走向知识工作——乃至服务所有人
00:36:07 给高级用户的建议与 AI 辅助绩效评估
00:40:41 OpenAI 内部的 AI 网络迷因与千万用户规模的发布
00:44:39 OpenClaw、个人智能体与作为操作系统的 ChatGPT
00:50:24 子智能体、Ultra 模式与用户需要多少控制权
00:54:39 ChatGPT 记忆、个性化与 Chronicle
01:00:19 AI 如何重塑产品开发与科技行业角色
01:03:15 想法、品味,以及 LLM 为什么难以产生新想法
01:04:42 衡量生产力、高质量出手机会,以及活动量与进展的区别
Swyx [00:00:00]:我们现在和来自 OpenAI 的 Akshay 一起坐在演播室里。欢迎。
Akshay Nathan [00:00:07]:谢谢。
Swyx [00:00:08]:我们有信任的共同主持人 Vibhu。你最近推出了 ChatGPT Work。你领导核心产品工程。这一段旅程真是漫长。我觉得很有意思的是,你从无代码或低代码开始,用 Walrus 和 Airtable。在某种程度上,ChatGPT Work 就像超级应用的超级应用——说白了,这就是终极的无代码方案。你只需写一个提示词。
Akshay Nathan [00:00:32]:哈哈,事情就是这样圆满收场的,很有意思。我觉得在我职业生涯的很长一段时间里,我从消费者金融科技起步,之后就有了这样一个想法:作为工程师,我们用代码能做的事,如果我们能以更容易获取的方式带给更多人,那将是真正的魔法。我们曾在一家初创公司工作。有趣的是,在大语言模型出现之前——甚至在视觉大语言模型之前——我们在研究如何用 AI 做自动化测试。那时候有点不靠谱,但我们尽力了。然后我在 Airtable 工作了一段时间,基于同样的想法:如果我们能把数据库或数据库背后的基本概念带给人们,这对他们会很有用。但一旦大语言模型出现,就变得很清晰——这是缺失的一块,是把代码的魔法带给每个人所需的缺失技术,而他们无需知道底层的原理。所以,我认为这次发布以及我们所做的很多事情,就是这一想法的体现。
Vibhu [00:01:33]:你加入时情况如何?所以你 2023 年加入了 OpenAI。现在我们有这么多东西——ChatGPT、Codex 应用、ChatGPT Work。事情改变了吗?
Akshay Nathan [00:01:44]:我觉得更有意思的其实是什么没有改变。首先,我记得我加入时,大概有 500 人。我当时有点担心的是,我在寻找更早期的公司,它会感觉足够像初创公司吗?我加入后的感觉是,"这比我想象的还要像初创公司。"这一点直到现在都没有改变。我认为自下而上的雄心和任何人都能做任何事或想到一个点子并将其发布的能力,真的很酷。从使命角度来说,真正吸引我的是这个使命——把前沿智能带给每个人。建造 AGI,然后把它带给每个人。我们当时就认识到,这个愿景不会是线性进展。我们可能会尝试不同的产品,有些会成功,有些不会。但愿景始终未变,使命始终未变,我们现在开始看到各个部分聚集起来,这真的很酷。
Swyx [00:02:40]:你做过企业相关的工作。很多人从未接触过 ChatGPT Enterprise。你从那里学到了什么,现在带到你的工作中?
Akshay Nathan [00:02:52]:我认为企业中没有一刀切的解决方案。我还记得 ChatGPT Enterprise 早期,我们和客户交谈时——那大概是 ChatGPT 发布一年后——每个人都很兴奋地想把 AI 引入他们的企业。有很多团队被建立起来了。像是一个 AI 部署团队,配着巨大的预算。如果你问任何人他们对什么感到兴奋,或者他们想解决什么问题,起初你会得到比较基础的答案,像"是啊,我们有很多上下文和数据什么的。"但如果你进一步追问,"他们想在工作场所用 AI 实现的具体用例是什么?"你会得到完全不同的、令人惊讶的、五花八门的答案。这很有意思——你使用这些模型和产品时,有一个盒子,你可以对它说任何东西,这就是魔法。但另一方面,这也意味着你不知道用它做什么。在企业中,我认为很大一部分是要在用户所在的地方与他们会面——他们想解决什么用例,然后教他们如何用 AI 在这个地方获得杠杆效应。
Swyx [00:03:56]:你能把那和前置部署工程有意义地区分开吗?
Akshay Nathan [00:04:01]:我认为有上市策略这一面,也有产品这一面。你需要有人在产品这一面。我认为,不管我们在前置部署工程上做得多好,最终,如果用户在看他们的电脑或手机,我们在产品中的工作就是赋能他们,告诉他们该往哪里去。我们对此感到非常兴奋。
Vibhu [00:04:24]:你认为过去三年的采用中有所改变吗?有过阶跃变化。你们有推理模型之类的东西。企业是否仍然存在同样的问题——黑盒、不知道怎么用——还是事情已经改变了?
Akshay Nathan [00:04:39]:我们现在看到,采用在激增,对吧?每个人都对此感到极其兴奋。感觉好像有数百万甚至数亿人在使用 ChatGPT。他们现在理解了如何大体上与 AI 合作。但每次有新能力解锁时,就像我们现在看到的 AI 智能体,还是有一小批早期采用者真正理解了它——他们说"你可以做任何事。你只需确保上下文在那里,它连接到了正确的工具,而且你在监督它,那样的话任何事都是可能的。"但除此之外还有一个 10 倍或 100 倍更大的市场,他们还没有领悟到这一点,还看不到这个可能性。所以我认为那就是下一个阶段。要回答你的问题:我认为采用已经开始,而且增长很快,但我认为机会比这大得多。这正是我们想要参与的地方,尤其是通过 ChatGPT Work。
Swyx [00:05:27]:好的,让我们跳到 ChatGPT Work。大概一个月前宣布的。导向这个决策的流程是什么?这里涉及超级应用的整体合并。这是我们的正式称呼吗?你们还废弃了浏览器。总结一下你最近几个月在这个项目上的工作。
Akshay Nathan [00:05:50]:是的。现在感觉像是很久以前的事,但实际上才几个月。我认为最重要的推动力是当我们发布 Codex 或内部有了 Codex 时——这真的让我们惊讶。我认为我们最近公布了一些数据,表明在 OpenAI 内部,非开发者中采用 Codex 有了真正的拐点。在这个产品开发过程中,我会参加这些 UXR 会议,和内部的人交谈。给我印象最深的是,你去和战略财务、市场营销或其他部门交谈,他们都在用 Codex 来处理他们的用例。那部分很酷,但真正让我印象深刻的是人们使用 Codex 时的骄傲感。像是……
Swyx [00:06:34]:就像"我不应该在用,但我就是在用。"
Akshay Nathan [00:06:36]:就是那样。他们早早接触到了新东西,但也是一种——他们感觉自己拥有了超能力,对吧?我们当时意识到的是,Codex 的力量,AI 智能体的力量——我们已经有了一个庞大的人群基数,他们已经了解和热爱 ChatGPT。那么我们怎样向他们展示这一点呢?我们怎样把它带给他们?这是一个很难的产品问题,是个很棘手的事情,对吧?有很多种方法可以解决。所以我们随着时间推移称之为"合并"和"超级应用",最终在 ChatGPT Work 中推出——那就是我们如何做到的。但这来自于一个基本认识,那就是这种力量不仅仅是给开发者的——比我们当时想象的早得多,它可以被扩展到每个人。
Swyx [00:07:17]:你对这些产品的定位有什么不同吗?所以,它是为谁而设的,对吧?Codex 最初从命令行开始,然后是应用程序。现在 ChatGPT Codex 和 ChatGPT Work 合并了,这是为普通用户、企业、还是工作场景而开放的?你如何定位它?
Akshay Nathan [00:07:36]:我认为我们想把它定位为——如果你在做工作相关的事情,没有更好的词来说的话,对吧?
Akshay Nathan [00:07:42]:我负责的支柱,可以说就是生产力。这也是团队的名称。之所以这样命名,之所以称它为“生产力”,而不是“企业”“工作”之类的名称,是因为它也涵盖个人生产力,对吧?我见过人们使用 ChatGPT Work 处理个人生活中的事情。严格来说,你不会把这些事情归类为工作,但这些智能体非常擅长处理它们。最近有个例子,有人在我们的 Slack 上分享:他的包裹没有收到,然后从 Amazon 或负责配送的快递公司那里拿到了包裹的照片,于是他让 ChatGPT Work 查清楚包裹到底在哪里。这个智能体非常执着,它拿着那张图片,查看了用户所在社区附近的一大堆房源信息,最终准确找出了包裹所在的公寓楼,并向用户提供了相关信息。所以我认为,所有这些与工作或生产力有关的事情,都是我们希望这款产品能够处理的。
你刚才问到了 Codex。我们认为 Codex 是一个能够长期存在的品牌,但我们有一项原则:我们不希望用户被困在某个标签页或某种体验中,以至于无法获得产品的完整能力。因此,在桌面端产品的 Codex 部分能做的所有事情,在 ChatGPT Work 中也都能做,反之亦然。不过,我们确实做出了一些带有明确倾向的产品决策。例如,如果用户身处 Git 仓库中,我们应该向终端用户展示多少 Git 状态?或者,我们应该在多大程度上让查看智能体思考过程的体验以 diff 为核心,从而让用户默认就能看到 diff?在安全方面,我们又该如何考虑沙箱机制,确保在一种状态和另一种状态下都采用正确的默认设置?这些背后确实包含了一些明确的产品主张,但我们不希望用户还得自行选择应该使用哪一种体验。
Swyx [00:09:26]:这对于 AGI 来说是个很好的目标,对吧?人们不想还得选择自己想要哪个版本的 AGI,他们只希望 AGI 替自己作出决定。我能得到一个明确答案吗?或者说,这一点对我而言还不是特别清楚。Codex 的智能体运行框架和 ChatGPT Work 的智能体运行框架是同一个吗?它们之间的区别只是 UI 提供的操作方式不同,还是在提示词层面,甚至更底层也存在差异?
Akshay Nathan [00:09:49]:运行框架是相同的,二者共享同一套运行框架。在这两款产品中,我们都改进了运行框架,使其更适合知识工作,尤其是在插件、计算机操作和产物处理方面。无论使用哪一种体验,你都能获得这些能力。在用户体验方面,我们对于 Codex 模式下的 UX 应该是什么样、应该如何运作,有一些明确的产品主张。此外,还有我刚才提到的一些沙箱相关差异,但底层的运行框架和能力应该是相同的。
Swyx [00:10:16]:我只是有些好奇。也许我们可以——有没有什么查询,可以让我们在这两种模式中看到不同的结果?
Akshay Nathan [00:10:23]:有。我试过让它在两种模式下分别创建一个退休规划计算器电子表格之类的东西。在 Codex 模式下——你可能需要位于某个仓库中才能看到——你会看到它正在创建的工作表所对应的 diff,以及文件编辑之类的信息。但在 Work 中,你看不到这些内容。
Swyx [00:10:42]:我觉得这样就非常清楚了。我还想深入了解的另一件事是你的生产力团队。除此之外还有什么团队?首先,除生产力之外,还有哪些顶层团队?难道所有事情不都属于生产力吗?
Akshay Nathan [00:10:55]:这个嘛——
Swyx [00:10:55]:科学?
Akshay Nathan [00:10:55]:我们有一个专注于 ChatGPT 的团队,也就是面向消费者的核心聊天体验。我认为那不全都属于生产力。人们每天使用 ChatGPT 进行搜索、思考如何给亲友写消息、学习新主题,等等,还会用它创作图片。聊天中还有大量其他功能,数以亿计的用户都在使用它们,因此非常值得投入一个高度专注的团队。此外,还有专注于企业、基础设施和 API 等方面的团队。
Swyx [00:11:33]:我把它调出来。
Swyx [00:11:34]:好了,我已经把两个都运行起来了。这是 ChatGPT Work,这里还有一个 Codex 版本。我选择了《Five Little Ducks》这首歌,所以还需要一点时间。
Akshay Nathan [00:11:43]:嗯。
Swyx [00:11:43]:我想我们就让它们继续在后台运行,等它们完成后,再看看其中的一些差异。
Akshay Nathan [00:11:48]:好。不过我觉得,如果你现在切回 Codex 版本,马上就能看到——
Swyx [00:11:53]:它假设——
Akshay Nathan [00:11:54]:比如——
Swyx [00:11:54]:它假设使用 Git。对,对。
Akshay Nathan [00:11:56]:那个动态岛默认假设你身处 Git 仓库中。你可能会错过一些内容,因为其中一部分位于包含这些更改的实际思维链中,这也涉及我们展示这些内容的方式,不过,是的。
Swyx [00:12:07]:这里面有没有什么反直觉的情况?比如,你原本想发布某个功能,后来收到反馈,然后说:“不,我们还是别这么做了。”背后的思考是什么?
Akshay Nathan [00:12:14]:你是说 ChatGPT Work?
Akshay Nathan [00:12:17]:我认为,我们原本可以选择的一个方向,是让这两种体验保持完全分离。所以问题就是,为什么——
Swyx [00:12:22]:做成不同的应用。
Akshay Nathan [00:12:23]:没错,比如做成不同的应用;甚至可以放在同一个应用里,但作为不同的、完全不一的——