文章详述如何在个人硬件上本地运行 GPT-4 级前沿模型,涵盖开源工具链、硬件配置建议与性能权衡,为私有化 AI 部署提供完整路径。
在我的一门课上,我问了一个我一直不敢问但又非常想知道答案的问题:"你们中有谁担心毕业后找不到工作?"在场的 150 人中,大约 80% 举起了手。这相当于大约 120 名学生异口同声地回答:他们不相信自己在未来有一席之地。
另一个故事来自邮件。那些迫不及待想要毕业的 PhD 学生,因为他们想去加入一个前沿实验室,他们认定学术界的科研已经毫无意义。他们在倒计时离开的日子。
我相信这两个故事都是错的,而且错在同一个地方。它们假设科研的未来属于拥有最多 GPU 的人。我认为事实恰恰相反。学术界或许即将迎来一场复兴,下一个十年最激动人心的工作将发生在大学实验室——不是因为它们资源有限,而是因为这些限制。
这周我们将用代码而不是文章来论证这个观点。
这篇文章有六个部分:为什么像我们这样的实验室如今发布的是生态系统而不是论文;开源周里究竟有什么;为什么我不断遇到的悲观情绪是错误的;应该放下什么,又该坚持什么;一旦放下了执念,科研会是什么样子;以及为什么复兴会在学术界发生。
科研的基本单元不再是论文
去年发生了一些变化,但我们大多数人都没有更新自己的习惯来适应它。
有了 AI 智能体,每个项目的科研变得容易且快捷。以前需要一年工程和实验的工作现在只需要几周,有时甚至几天。这里是我花了更长时间才看清的部分:当每个独立项目都变得容易之后,零敲碎打的工作就不再是好的研究了。这里一篇论文,那里一篇论文,每篇都自成一体的,每篇都要求读者自己把碎片拼凑起来——那是每一个成果都弥足珍贵那个世界的格式。
难度并没有消失,只是转移了。发表一篇论文不再困难,困难的是发布一个连贯的生态系统。
科研的基本单元是生态系统。
这就是开源周的意义所在。当我和我的学生开始时,我们的目标是构建相互构建而非仅仅共存的组件,这样每个部件都能让下一个部件更有用。我和我的实验室相信利用我们的学术自由,为每个人免费带来最好的 AI 工具。这是大学里独一无二能做到的事。具体来说,这意味着构建开放系统、让模型在本地运行更便宜、让本地模型更强、构建能复制前沿性能的深度和自主科研的本地系统,以及创建构建领域特定强化学习环境的新方法。
所有这些都处于三件事的交汇点:推理服务框架、AI 智能体测试框架和工作,以及将两者结合成自主科研系统。所有这些都必须易于使用,因为只有资深研究员才能运行的开源不算开源。可访问性有两半——你需要的资源和需要的专业知识——其中只有一个受硬件固定。几块 GPU,或者一台 MacBook,可能就够了。专业知识需求是一个设计问题,解决它需要把用户不需要关心的每个技术细节抽象掉。这正是我们大部分精力所在的地方,在 AI 智能体测试框架中体现得最明显。
在开源周开始之前,我不打算把所有东西都透露出来,所以现在只能告诉你们这些。
如果你问我一个小实验室今天能做什么,我们会给你展示三样东西:前沿自主科研、我所知道的最高效测试时扩展,以及比 Claude Code 或 Codex 实现的高效得多的自动压缩。
先从测试框架开始,因为它让其他一切变得可用。
你可能听说过持续运行数小时、数天甚至数周的 AI 智能体对话。对大多数人,特别是对从未与 AI 智能体合作过的人来说,这一直是个谜。它是如何实现的。你让我们的测试框架指向一个代码库——比如说一个带有 CUDA 内核的推理框架——然后告诉它去优化这些内核。之后你就可以离开了。它会持续改进,穿越那些进展缓慢且令人沮丧的部分,一直运行直到你回来。一路上不会提供任何反馈,所以 AI 智能体每当遇到不明确或不确定的情况时都必须自己想办法。
这就是我们用 Mac 和 Metal 实现推理框架的方式。一条命令让 AI 智能体在各种内核上自由发挥。最终得到的是 Qwen 3.6 35B-A3B 模型以每秒 450 个 token 的速度进行量化推理,在每权重 1.5 比特的情况下输出质量很高。半精度模型每个权重需要 16 比特;在 1.5 比特下,同一个模型只需要约十分之一的内存,而且运行速度足够快,感觉像本地进程而不是远程服务。
然后是这篇文章标题中的主题。当那些曾经遥不可及的模型能够在你已有的硬件上运行时,会发生什么?
Qwen 3.8(270 亿参数)一直是流行的本地模型。我们的框架让你可以在单块 24 GB GPU 上运行它的大哥 Qwen 3.8 Flash Next(1250 亿参数)——就是普通台式机里的那块卡。有了 AMD Strix、NVIDIA DGX Spark 或配备 128 GB 内存的 MacBook,你可以运行 DeepSeek V4.1——一个 5500 亿参数的模型。你也不需要管理上下文长度:压缩和上下文处理都是自动的,即使在长上下文下推理仍然很快。
然后是最让我兴奋的部分。
我们将这些组件组合起来,并进一步推向自主科研,在这个过程中我们构建了一种我从未见过精度的全新信息检索技术。该系统击败了前沿实验室的深度研究系统,并且产生了比 Sakana AI 的系统或 Google 的 ScientistOne 更好的自主科研成果。它完全在本地运行,压根不需要互联网访问。
使用它很简单。让我给你们看看我做过的实验。
我让 AI 智能体在生物信息学领域找一个值得研究的问题——因为我对此不太了解——而且标准很具体。进展必须快速。评估必须足够便宜,能在我们已有的硬件上运行。而且必须是一个新鲜的问题,过去四周内有活跃的科研发表,这样我们做的就是这个领域尚未定论的东西。AI 智能体返回了三个问题。我们选了第一个,在大约两小时内,它建立了启发式方法的新下界,开发并测试了文献中最好的启发式方法,向使用 AI 模型训练的昂贵方法靠拢,并发现了每个人用来评估这个问题的数据源中的问题。我们没有在整体问题上达到最先进水平。但即便如此:在我实验室的一台机器上两小时的工作产生了四个结果,其中一个质疑了整个领域所依赖的评估数据。
这个系统不是我们为博客文章准备的演示。我的学生每天都在使用它。在它存在于测试框架之前,它在 Slack 机器人里,而当时它不够稳定,机器人有时会宕机。我没有邮件系统来提醒我 Slack 机器人下线,但我有次优方案:我的学生们经常给我写"Tim,Slack 机器人出了点问题,不工作了。能帮帮我吗?"在一次协作环境中,我在录制会议后使用了它:它从录音中生成研究问题,根据文献评估讨论过的想法,并将有前景的方向和没有前景的方向区分开来。然后创建了一份 Google 文档并发给学生。我这样做了两次会议。学生们喜欢它,但因为管道中有一个我手动复制粘贴两个组件的环节,所以很麻烦,于是我停了下来。接下来的两个会议我没有用它——然后学生们满怀期待地问我,我们能不能再次使用这个系统,因为他们发现它对理解自己的科研非常有帮助。
这是我唯一信任的科研工具评估方式:当你停止提供之后,人们仍然会主动要求使用它。
最后一部分是我们使用最多却最少谈论的。当你不想让 AI 智能体在对话结束后停止工作时,该怎么做?
Our answer is an auto-compaction technique called CliffCompaction. We have used it in the lab for months, and I, for one, want to never run an agent without it. It is considerably more powerful than the auto-compaction in Claude Code or Codex. Sessions with it run for millions of tokens, and some of mine have run past a hundred million. It also cuts overall cost by about fifty percent. One of our partners deployed it inside their company and measured a forty-five percent reduction in their total AI budget — nearly half of what they spend on AI, gone, without giving anything up. On KernelBench it reaches state of the art, beating methods far more complicated than ours, AlphaEvolve-style approaches and hierarchical memory systems among them, by a wide margin. We will published a strong version. We already parts of the next one autocompaction technique, and it is better.
我们的答案是名为 CliffCompaction 的自动压缩技术。我们在实验室里已经用了好几个月了,而就我而言,我想再也不用没有它的智能体。它比 Claude Code 或 Codex 中的自动压缩要强大得多。使用它可以运行数百万 token 的会话,其中一些会话已经运行超过了一亿 token。它还将总体成本降低约 50%。我们的一位合作伙伴在他们的公司内部署了它,测量到其 AI 预算总额减少了 45%——几乎是他们 AI 支出的一半,就这么消失了,却没有牺牲任何东西。在 KernelBench 上它达到了最先进水平,以很大优势击败了远比我们的方法复杂的方案,包括 AlphaEvolve 类方法和分层记忆系统。我们将发布一个强力的版本。我们已经在开发下一代自动压缩技术,它会更好。
It moves both sides of the cost/capability trade-off at once: sessions that run longer, and a bill that runs smaller. In other words, the agent stops forgetting what it was doing, and you stop paying for the forgetting.
它同时移动了成本/能力权衡的两端:会话运行时间更长,账单金额更小。换句话说,智能体不再忘记它在做什么,而你也不再为遗忘而付费。
Long sessions, lower bills.
长会话,低账单。
That brings me to the test-time scaling part of the list, because it falls out of the same trick. Auto-compaction cuts cost by about fifty percent, and you can reinvest the saving: instead of one rollout, buy several with the same budget. We have found the first practical method that turns multiple rollouts into significant improvement at the same cost, and while it is not practical for everyday engineering work yet, the leap to that level will not be difficult. Combined with local deployments, which are often underutilized, we believe this leads to a future where anyone can run many parallel agents on any single problem.
这把我带到了列表中的测试时扩展部分,因为它出自由同样的技巧。自动压缩将成本降低约 50%,你可以将节省下来的费用重新投入:不用一次展开,用同样的预算购买多次展开。我们发现了第一个实用的方法,可以将多次展开转化为同成本下的显著改进,虽然它对日常工程工作还不实用,但跃升到那个水平并不困难。结合本地部署——这些部署往往利用率不足——我们相信这将引领一个未来:任何人都可以在任何单一问题上运行许多并行智能体。
Why the pessimism is wrong
为什么悲观主义是错的
So why are 120 of those 150 students afraid?
那么,为什么 150 名学生中的 120 名会感到恐惧?
Three things are happening at once, and only one of them is about AI. The first is a belief that AI will take everyone's job. The second is a poor understanding of what AI does to work. The third is contagion: self-defeating ideas spread from person to person, and a room full of people who have heard the same pessimistic sentence ten times will produce an eleventh hand.
三件事同时发生,而其中只有一件与 AI 有关。第一个是相信 AI 会抢走每个人的工作。第二个是对 AI 对工作产生的影响缺乏了解。第三个是传染效应:自我打击的想法在人与人之间传播,一个房间里满是听过同一句悲观论调十次的人,就会出现第十一个举手的人。
Let's start with what AI does to work, because that is the part we can actually reason about.
让我们从 AI 对工作的影响开始,因为这是我们实际上可以理性探讨的部分。
Start with the profession everyone expected to go first. The prediction was that software engineers would lose their jobs first, and the recent trend went the other way: demand for software engineers is higher than ever. A software engineer with good agents produces new products, maintains existing systems, and expands them far more efficiently, so a company gets more value for every dollar it spends on that engineer. What the job requires has changed. It needs strong agent skills and, often, deeper specialization than before — the "software engineer" job no longer exists — and both are now within reach: agent skills come with time, and deep specialization, which used to take years, is quick to acquire with agents.
从每个人预期最先受到冲击的职业开始。预测是软件工程师会最先失业,而最近的趋势却走向了反面:对软件工程师的需求比以往任何时候都高。配备好智能体的软件工程师能更高效地生产新产品、维护现有系统并扩展它们,因此公司从每位工程师身上获得的价值更高。工作要求已经改变了。它需要强大的智能体技能,而且往往比以往更深入的专业化——"软件工程师"这个职位已不复存在——而这两者现在都是可以企及的:智能体技能随着时间推移会自然掌握,而曾经需要数年的深度专业化,借助智能体可以快速获得。
We live in an economy of incremental improvements. The next phone is not much better than the last one; the improvements are real but small, and they get harder to notice every year. Many services have converged the same way. A ride from Lyft or Uber is not a fundamentally different experience than it was, and it probably never will be, because there is not much left to change. You can only make the same thing slightly better so many times before someone stops paying for the next version.
我们生活在一个渐进式改进的经济体中。下一部手机并不比上一部好多少;改进是真实的但是微小的,而且每年都越来越难被注意到。许多服务以同样的方式趋同了。从 Lyft 或 Uber 叫车并不是一种与过去根本不同的体验,而且可能永远不会,因为已经没有太多可以改变的了。同样的东西你只能改进一点点这么多次,然后就会有人不再为下一个版本付费。
Progress comes in two forms, and they behave nothing alike. Call the pair improvement/capability: improvement makes what you already have slightly better, capability gives you something you did not have at all. An economy that only produces the first kind has a ceiling, no matter how hard everyone in it works. So look at what happens when technology delivers the second kind.
进步有两种形式,它们的表现截然不同。把这对概念称为改进/能力:改进让你已有的东西变得稍微更好,能力给你完全不曾拥有的东西。一个只产生第一种进步的经济体是有天花板的,无论其中每个人多么努力。所以看看当技术交付第二种进步时会发生什么。
Self-driving cars are the obvious example, and the interesting part is how unevenly they will arrive. Driving in complicated places like Europe or Asia is decades away. But in grid-like structures with well-behaved traffic — much of the United States — it will work much sooner, and it will change a great deal over the next two decades. Robotics is probably on a similar path: robots in households will free up work the way the washing machine did, and the point of freeing up work is not the work. It is the life you get to lead instead.
自动驾驶汽车是最明显的例子,有趣的是它们到来的速度参差不齐。在欧洲或亚洲这样的复杂地区驾驶,保守估计还要几十年。但在网格状结构且交通规范的地方——美国大部分地区——它会早得多地实现,而且在未来二十年里将带来巨大变化。机器人技术可能走在这条类似的道路上:家用机器人将像洗衣机一样解放劳动,而解放劳动的意义不在于劳动本身,而在于你能因此拥有的生活。
The same logic applies to the device in your pocket. The next phone might not be much faster, because chips do not get much faster anymore. It might be a very different device.
同样的逻辑也适用于你口袋里的设备。下一部手机可能不会快多少,因为芯片已经不再那么快了。它可能是一个非常不同的设备。
Take the case that people bring up when they tell me AI makes products worse, because it deserves an honest hearing. It is a cliché by now that bolted-on AI destroys the experience of the product it is bolted onto, and the AI features in Microsoft's products are almost universally severely disliked. I think that reaction is correct, and I also think it is a verdict on the integration, not on the technology. A well-designed AI experience changes how you interact, how you work, and how you structure your day. That version exists, and you can feel the difference in the places where it has been done well. ChatGPT is the prime example.
以人们在我面前提出 AI 让产品变得更糟的案例为例,因为它值得被认真对待。现在这已经成了陈词滥调:强行拼凑的 AI 会破坏它所附加的产品体验,而 Microsoft 产品中的 AI 功能几乎被普遍强烈厌恶。我认为这种反应是正确的,而且我认为这是对整合方式的 verdict,而非对技术本身的 verdict。设计良好的 AI 体验会改变你的交互方式、工作方式以及安排一天的方式。这种版本是存在的,你可以在做得好的地方感受到不同。ChatGPT 就是最好的例子。
Adoption of ChatGPT in the general population has been slow in the US. It is also undeniable that people catch up, and when they catch up it makes a difference in their lives — not a small difference, a structural one. How we produce knowledge and how we consume it will be changed permanently.
ChatGPT 在美国普通人群中的采用速度一直很慢。但同样不可否认的是,人们会追赶上来,而当他们追赶上来时,会对他们的生活产生影响——不是微小的差异,而是结构性的差异。我们生产知识和消费知识的方式将永久改变。
That change will bring turmoil and complexity, and I do not want to pretend otherwise. But turmoil is not where the story ends. Demand for new experiences and new products drives revenue, revenue drives hiring, and hiring is what people mean when they say job security. The pessimistic reading stops at the turmoil and forgets everything that follows it.
这种变化将带来动荡和复杂性,我不想假装并非如此。但动荡不是故事的终点。对新体验和新产品的需求驱动收入增长,收入驱动招聘,而招聘就是人们说 job security 时所指的。悲观的解读止步于动荡,忘记了随之而来的一切。
Let go of how you work. Not who you are.
放下你的工作方式。不是放下你是谁。
The future that is coming is a dramatic shift, and for many people it will be shocking, disappointing, and disillusioning. It does not have to be.
即将到来的未来是一个巨大的转变,对许多人来说,它将是令人震惊、失望和幻灭的。它不必如此。
The most useful thing you can do right now is to let go. Let go of how you did things. Let go of the sequence you were taught, where you learn the basics and how you do things more generally, finally, the problems. Let go of the idea that your value is stored in what you have already learned, because the tools you learned are being rewritten while you use them.
你现在能做的最有用的事情就是放下。放下你做事的方式。放下你被教导的顺序——先学基础,再学如何更普遍地做事,最后才是问题。放下你的价值存储在你已经学到的东西中的观念,因为你正在使用的工具正在被重写。
Letting go of how you do things is not the same as letting go of yourself, and the difference is the whole point. Identity is that which has to stay straight: what you do is negotiable, and who you are is not. Each of us does things to be engaged and to enjoy life, and when life changes, the way you spend your days changes with it — be it a new job, or starting a family, or so many other things. But people stay close to their own personality — not because they are stuck, but because they like it. That is who they are. We are all flawed, we all love someone, and we hold certain things to be important for ourselves and for others. Technology does not touch any of that. Once you are firm on who you are, everything else becomes negotiable, and being able to negotiate everything else is what lets you adapt quickly to whatever comes next.
放下你做事的方式并不等于放下你自己,而差异正是关键所在。Identity 是必须保持不变的东西:你做什么是可以商榷的,但你是谁不是。我们每个人做事是为了投入其中并享受生活,而当生活改变时,你度过每一天的方式也会随之改变——无论是换新工作,还是组建家庭,还是其他很多事情。但人们会保持与自己个性的一致——不是因为他们被困住了,而是因为他们喜欢它。这就是他们是谁。我们都有缺陷,我们都有爱的人,我们都认为某些事情对自己和他人来说是重要的。技术不会触及任何这些。一旦你坚定于你是谁,其他一切都可以商榷,而能够商榷其他一切正是让你能够快速适应接下来发生的事情。
So what does letting go look like in practice?
那么,放下在实践中是什么样的?
If you are an academic, you have to let go of papers. Not of writing them, and not of caring about them — the paper is still how we communicate. What has to go is the paper as the unit of achievement, the thing that gets counted and compared. If the ecosystem is the unit of research, then building something that other people can build on has to count for more than the next increment.
如果你是一名学者,你必须放下论文。不是放下写论文,也不是放下关心论文——论文仍然是我们交流的方式。必须去掉的是把论文作为成就的单位,那个被计数和比较的东西。如果生态系统是研究的单位,那么构建一个其他人可以在其上构建的东西,必须比下一次增量计算得更多。
If you are a student, you have to let go of the idea that you first acquire skills and basic knowledge and then solve problems. The order reverses. In the apprenticeship model — which is what a PhD already is, at its best — you do not read a textbook so that you can solve a problem later. You attach the problem, and you learn, build understanding and intuition along the way, and you spend your attention on the hard part instead of the part that can now be looked up.
如果你是一名学生,你必须放下先获取技能和基础知识再解决问题的观念。顺序颠倒了。在学徒制模式中——最好的 PhD 已经是这样——你不是为了以后能解决问题而读教科书。你是紧贴问题,在过程中学习、建立理解和直觉,你把注意力放在困难的部分上,而不是现在可以查到的部分。
Hard problems will be more common than ever. Not because the world will be harder, but because everything that is not hard will be automated away. The skill that matters is the one a PhD teaches and almost nothing else does: staying with a problem that does not yield.
困难的问题将比以往任何时候都更常见。不是因为世界会变得更难,而是因为一切不难的东西都会被自动化取代。重要的技能是 PhD 教的、几乎其他什么都教不了的:坚持一个不屈服的问题。
That is the skill set worth investing in.
这才是值得投资的技能组合。
What will research look like, and how do you train for it?
研究将会是什么样子,你该如何为此训练?
If agents change research this much, what does research look like from here, and how should we train a student to do it?
如果智能体如此大地改变了研究,从此以后研究是什么样子,我们该如何训练学生来做研究?
我在这个问题上思考了大约一年,没有一个干净的答案,但似乎开始有了些眉目。担任教职比做博士研究有更多的责任,留给深入钻研一项技能再传授给学生的时间更少。但我决定有所取舍来腾出时间——用于自己与 AI 智能体协作,用于摸索在 AI 智能体辅助下做研究应该是什么样子,用于发现究竟是什么让这个过程真正有效。这个权衡是我一直在做的。
经过大约一年的实践,博士生的协作方式已经浮现出一些具体的模式。例如,学生应该以整个生态系统作为工作的单元;学生应该在多个项目上并行推进;学生应该采用先动手攻击问题、再在过程中逐步理解的方法。
我在卡内基梅隆大学正在设计一门为期四周的短期课程(下周开课),以及一门面向下学期的完整课程,目标是将其全部发布在 YouTube 上,这样任何人都可以构建这些 AI 智能体技能。
有了正确的 AI 智能体技能,未来并不显得可怕。它令人兴奋。有一个过渡期,我不会假装它是舒适的,但一旦跨越过去,可能性就是无穷的。最初几周使用 AI 智能体时,这种兴奋感几乎都站不住脚。真正的东西稍后才到来,一旦你对其实际产出有了清醒的认识。从那以后,兴奋感就站得住脚了,转化为研究中的快速进展。
开源周(Open Source Week)就是这种进展的样子。
学术界正在经历一场复兴
那么,你应该在哪里做这项工作?
我的答案是:在大学实验室里,而且比你想象的更早。
原因就是我开头提到的那个。AI 智能体让你能够发现并攻,那些不需要大量资源、但影响可能巨大的问题。这个空间——低成本可攻击且高价值可解决的问题——非常广阔,而且完全没有竞争,因为所有有资源的人都去了别的地方:在规模上竞争,在需要数千块 GPU 的问题上竞争,在只有最大型实验室才能尝试的事情上竞争。小型实验室拥有的是创造力、时间和研究大型实验室无法触及的问题的自由。事实证明,这是一种与所有人正在追逐的不同的优势。
开源周是我们证明这一信念的尝试——我觉得我们做得很好!与我的学生们一起完成所有这些工作真是太有趣了。我们是一个只有几块 GPU 的小型实验室。开源周将推迟一天(仍在完成那份草稿),但从明天开始,我们将发布两个开源项目和四篇论文,关键在于它们是一起到来的,作为一个整体 package,其中的每个部分使其他部分更有用。
这一切并非按计划发生。这一周能够成事,是因为我的学生和我要的是同一件事:为开源做贡献,构建人们能用的东西——不一定是产品,尽管其中一些是研究产品,而是以前不存在的新知识和新技术。我想四周前就发布。学生们的项目已经完成一个多月了,学生们耐心地等待,这样我们就可以将所有东西作为一个生态系统一起发布,而不是在几周内零散地发布公告。将这一切整合在一起比我预期的要更加繁重——协调六次发布是一项与做研究不同的技能,而且是我没有练习过的。我希望这是值得的。
如果这能成功,研究将在一个前所未有的层面上变得触手可及,并且证明了我认为学生们在当前急需听到的东西。几个人配上几块 GPU 就能构建与前沿竞争的系统。这场复兴不需要任何人的许可。你直接去做就是了。
所以下一次我问 150 名学生谁担心找不到工作时,我希望举起的手更少。工作就在那里。学术界的未来非常光明,我对接下来的岁月感到兴奋。