论证本地优先 AI 的必要性,从能源消耗、运行成本、数据隐私角度剖析 Token 经济对软件架构的影响。
今天大多数使用 AI 工具的人不会想到 token,坦白说,他们也没必要想。每个单词、每个建议、每个自动补全都由 token(被大型模型处理的语言片段)组成的这个概念,更多地属于机器学习研究论文和工程图表,而不是大多数用户的实际体验。
然而,这些 token 构成了现代工作方式中越来越普遍的无形基础设施。它们是 AI 的力量单位,我们生产力的组成部分,也许最令人惊讶的是,它们是能量和成本的微小承载者。
使用 AI 的体验已经变得如此流畅、如此嵌入式、如此无缝,以至于很容易忽略表面下真正发生了什么。
当你打开聊天机器人、粘贴一张笔记列表,或要求它重写你的文档时,感觉上不像是在利用远方数据中心 GPU 的力量。感觉上就像是机器在思考。但实际上,这些请求,无论简单还是复杂,都依赖于庞大的计算基础设施,这些基础设施带来了环境和财务成本。
虽然从单个用户的角度来看,这种成本可能不显著,但它以我们才开始理解的方式扩展。
在这个 AI 无处不在的时刻,重要的是要停下来问问自己,我们在构建什么样的基础设施,我们在规范化什么样的软件,我们在大规模强化什么样的实践。因为虽然起初可能不明显,但 AI 工具的能量含义,尤其是在云中,是真实的、可衡量的,而且在增长。
根据国际能源署的数据,全球电力生成碳强度的平均值约为每千瓦时 400 克 CO₂。一个依赖云托管 AI 模型进行日常任务的开发人员,仅通过推理就可能每年间接消耗超过 3.65 千瓦时。
这相当于每个开发人员每年超过 1.4 千克的 CO₂。虽然这些数字单独听起来可能不显著,但当乘以数千甚至数百万开发人员时,影响就难以忽视了。从传统软件向 AI 辅助工作的转变不仅改变了任务的完成方式,还改变了每个工作流的物理能耗足迹。
大部分能量使用都是不可见的。它不会显示在电池寿命或浏览器性能中。
相反,它发生在设备外部,在大多数用户从未见过的大规模服务器中。
用于训练深度学习模型的计算量在 6 年内增加了 30 万倍。数据来自 Green AI。
这正是挑战所在:当成本和排放被抽象化时,就很难对我们使用的工具和使用方式做出知情的选择。
这不是呼吁放弃 AI,也不是回到更简单的时代,而是邀请重新想象如何提供智能,一种更有意识、更高效、最终也更赋能的方式。
在 Pieces,我们在 local-first AI 上的工作并不是作为一项环保举措开始的,而是作为对我们从开发人员那里听到的常见挫折的实际回应,对延迟、可靠性、隐私和云依赖性的担忧。
我们的 CEO Tsavo Knott 从 14 岁开始编码以来就一直专注于开发人员生产力——这最终形成了 Pieces 本身的基础。在许多方面,Pieces 背后的想法就是这样:代码片段,仔细保存、重用和重新利用,帮助开发人员更快地行动,少想重复工作。
当我们构建工具的核心功能时,我们做出了一系列以自主性和速度为中心的架构决策:直接在设备上运行推理,避免不必要的云调用,以及投资更小、更快、针对特定任务的模型,这些模型可以在低资源环境中高效运行——nano 模型。
随着时间的推移,很明显这些决策有另一个更深层的好处。它们不仅使我们的工具更响应、更安全,而且更可持续。在设备上以几毫秒运行的 nano 模型不仅节省 API 调用,还节省电力。
它消除了在远程数据中心中启动能量密集型 GPU 的需要。它避免了每个 prompt 和 completion 的数据传输和碳开销。简而言之,它在技术上和环境上减轻了负担。
我们学到的是,经过深思熟虑的模型设计,与正确的基础设施相配对,可以改变 AI 辅助工作的经济学和能源概况。
与其为每项任务调用一个 700 亿参数的云模型,我们开始通过参数少于 1 亿的模型来路由更简单的、重复性的操作。
这些 nano 模型,经过训练和微调以处理非常具体的责任,如标记内容、链接上下文或分类用户意图,的运行成本仅为一小部分能量。
内部基准,由麻省理工学院超级计算机和 GreenAI 等研究支持,显示能耗范围从每 token 1 毫焦(nano)到每 token 3-4 焦(云 LLM)。这是数个数量级的差异,用户在功能方面根本不需要注意,但在总体上却重要得多。
这也与我们的智能上下文系统扩展密切相关,特别是 Pieces MCP,它编排了如何在你的工作区中处理和呈现信息。
通过依靠本地推理链(由协作的 nano 和小型语言模型构建),MCP 允许我们在不重复调用云的情况下提供高上下文 AI 协助。
这不仅改进了性能和隐私,还大大减少了能量开销,因为即使是长格式的理解和跨笔记推理现在也可以本地进行。
这种架构转变不仅仅是关于优化。它是关于收回对 AI 如何在我们构建的工具和我们依赖的工具中使用的代理权。它是关于挑战智能必须是集中的、抽象化的、能量密集的这一假设。
它是关于认识到基础设施的小改变可以导致有意义的结果,不仅对于个人和团队,而且对于我们都居住的更广泛的系统。
我们不是在假装 local-first AI 可以解决所有问题,或者更小的模型总是更好的(尽管有些公司转向了它们)。有些任务总会需要更重的计算、更丰富的上下文,或更复杂的推理。
但我们倡导的是平衡:一种发展模式,其中规模是有意的,而不是自动的;其中成本是透明的,而不是隐藏的;其中性能与原则相匹配。
我们知道一家 AI 公司写关于 AI 环保成本的文章是有讽刺意味的。但正是这种矛盾使我们相信这个对话是值得进行的。
我们生活在一个聪慧的系统正在改变工作方式、软件构建方式和问题解决方式的时刻。随之而来的是责任,不仅要问 AI 能做什么,还要问它是如何做的。
好消息是可持续 AI 不一定感觉像是一种妥协。
实际上,恰恰相反。当你为 local-first 执行而设计时,你得到更快的工具。当你训练和微调更小的模型时,你得到更高的效率和特异性。
当你最小化云依赖时,你得到更强的隐私和更好的离线支持。当你以测量和透明度做所有这些时,你得到信任,不仅来自用户,还来自依赖你软件的每个利益相关者。
最后,这不仅仅是关于节省几瓦或避免 API 账单。
它是关于在智能和基础设施之间建立更好的关系。一种性能、隐私和可持续性相互强化而不是相互权衡的关系。
我们构建的工具反映了我们所承载的价值观。在一个每天都变得更聪慧的世界中,问题不是我们是否会使用 AI,而是我们是否会明智地、负责任地使用它,并意识到我们在此过程中塑造的系统。
Schwartz et al., "GreenAI" (2019): https://arxiv.org/abs/1907.10597
Power-Hungry Processing (2023): https://arxiv.org/abs/2311.16863
International Energy Agency: https://www.iea.org/reports/electricity-market-report
U.S. Energy Information Administration: https://www.eia.gov/electricity/monthly/
OpenAI GPT-4o Pricing: https://openai.com/api/pricing