阐述AI发展的新方向不是追求规模,而是SLM、本地优先、Agent编排等实际应用层的创新。
最好的技术会消失于无形,它与人无缝融合,让你感觉它就像自身能力的延伸。对 AI 而言,这意味着走出聊天窗口,成为一层不可见却又充满魔力的环境认知。它不再只是由你向 AI 发出 prompt;AI 也会主动向你发出 prompt。
想象一下,有一位沉默的伙伴发现你的航班延误了,便查看会议参与者的日历,主动找出一个所有人都方便的新时间,然后用一条简单的 prompt 询问:“你的航班延误了一小时。我找到了一个所有人都方便的新时段:下午 3 点。需要我调整会议时间吗?”在这样的协作关系中,AI 会主动行动,却不会令人厌烦;它只在最关键的时刻出现,并遵循一个原则:每次打断带来的价值,都必须高于它所消耗的注意力。
这种深度的上下文集成需要信任、隐私与性能,而远程运行的云端模型并不适合满足这些要求。要构建这样的未来,唯一可行的方式就是在设备端运行 AI。
转向本地优先的世界,还会带来一个强大却隐蔽的好处:它迫使我们放弃“扩大规模这条作弊捷径”。多年来,主流观点一直是把模型做得更大。这种暴力扩展的思路,就像认定通往智能的唯一道路是不断扩大灵长类动物的新皮质,却忽视真正促成人类认知诞生的关键架构转变与全新连接方式 1。
以一套有原则的方法探索参数规模低于十亿的 AI,有望催生新一轮创新。接受资源约束,会迫使我们发挥创造力,把注意力集中在智能最根本的组成部分上。这不是退步,而是朝着一种更优雅、更精密的 AI 构建方式实现跃迁。
在本地运行,为我们开启了一片丰富的新研究前沿。AI 必须成为设备上一位彬彬有礼的客人:安静运行,既不能让 CPU 使用率突然飙升,也不能耗尽电池 17, 18。要做到这一点,需要取得超越模型管理本身的突破。
最根本的挑战在于架构。怎样才能设计出凭借高效率获得强大能力,而不是靠庞大规模堆出能力的模型?我们的目标,是打造参数规模可能在 1B 左右的紧凑型推理引擎,让它们精于纯粹的问题解决能力,而不是拥有百科全书式的知识。知识蒸馏 8, 9、剪枝 10, 11 和量化 12 等先进优化技术,让这一目标成为可能:它们可以把大型模型的能力智能压缩到更小的体量中。近期关于 Hierarchical Reasoning Model(HRM)等受大脑启发的新型架构研究,证明这条道路极具前景。一个仅有 2700 万参数的模型,无需大规模预训练,就能在复杂推理任务中取得出色表现。这也是对循环式、层级式智能长期理论原则的一次现代验证 47, 48, 49。
在改进模型之外,本地运行还引出了一个令人着迷的编排问题。解决方案是 Agentic Constellation:由一组超高效 SLM 组成团队,再交给能够感知资源状况的 orchestrator 统一管理。近期研究指出,对于 Agent 执行的大多数重复性与专业化任务,SLM 不仅足以胜任,而且从本质上说,比规模更大的模型更为合适 2, 3, 4, 5, 6, 7。然而,这一领域正面临一场关键却基本未得到解决的危机:当今的 multi-agent 系统从根本上十分脆弱,很容易出现系统性故障,例如“Reasoning-Action Mismatch”,即 Agent 的计划与实际行动并不匹配 40。这暴露出一道危险的鸿沟:我们已经有能力构建这些系统,却还不理解如何让它们真正可靠。
当本地资源约束、架构与可靠性这些挑战被清晰定义之后,生物学自然就成了最合适的灵感来源。生物系统并不是一张完美的工程设计图,但它是我们唯一拥有的、能够解决这些具体问题的可运行智能模型 45。大脑的卓越能力,来自大量深度互联、各有所长的专门区域通力协作,而其功耗低得惊人 46。
这指向了受 Thousand Brains Theory 等深刻神经科学框架启发的架构:智能并非来自自上而下的命令,而是由数千个并行模型达成共识后涌现出来 50。它还启发我们基于 Free Energy Principle 构建 Agent,使其拥有内在动机,主动学习并减少自身对世界的不确定性,从而直接应对可靠性危机 51。这些并不只是优美的类比,而是设计下一代健壮、可靠 AI 时可以直接付诸行动的原则。
这条论证路径非常直接:真正深度集成的 AI,需要采用本地架构,才能提供隐私保护、更低延迟与离线可用性——无论是在飞机上还是太空中。这会带来一系列约束,堵死扩大规模这条作弊捷径,迫使我们解决更有意思的问题:模型架构、学习与编排。而在这些问题上,生物学为我们提供了最好的指引。
这不仅是一项技术选择,也是一条对所有人都更好的发展方向。对用户而言,它意味着真正个性化且私密的 AI。对行业而言,它意味着可持续的经济模式;部分分析显示,本地 inference 的成本可以比云端 API 低 1,000 倍以上 13。这种效率并不只是为企业省钱,它还是强大的 AI 能够在手机上运行、又不至于在五分钟内耗尽电池的关键。
对研究人员而言,这是探索新前沿的号召。高效架构、新型算法,以及解决 agentic AI 系统性可靠性危机,都是当今最迷人、也最悬而未决的问题。对创业者而言,这里存在一个明确的市场机会:打造新一代智能应用,提供中心化的既有巨头永远无法匹敌的隐私性、响应速度与集成程度,并通过相应的商业模式,把效率提升带来的收益传递给用户。
我们的终极目标,始终是构建能够赋能人类的技术。通过打造这些本地运行、具有“新皮质”特征的认知星座,我们终于可以让 AI 以最深刻的方式实现这个目标:消失于无形,成为人类心智安静而强大的延伸。
1 Wikipedia.(2024)。大型语言模型。
2 Belcak, P., Heinrich, G., Diao, S., Fu, Y., Dong, X., Muralidharan, S., Lin, Y. C., & Molchanov, P.(2025)。Small Language Models 是 Agentic AI 的未来。arXiv:2506.02153。
3 Splunk.(2025 年 2 月 17 日)。LLM 与 SLM:大型语言模型和小型语言模型之间的差异。
4 arXiv.(2025 年 7 月)。预训练 Tiny Language Model 呈现出与 Large Language Model 定性相似的特征。arXiv:2507.14871。
5 arXiv.(2025 年 7 月)。用于层级式税务代码预测的领域自适应 Small Language Model。arXiv:2507.10880。
6 arXiv.(2025 年 7 月)。用于知识提取的 Language Model 级联。arXiv:2507.22921。
7 Future AGI.(2025)。Small Language Models 是 Agentic AI 的未来。
8 arXiv.(2025 年 7 月)。AdvDistill:用于推理的奖励引导式数据集蒸馏框架。arXiv:2507.00054。
9 OpenReview.(2025)。利用反馈与推理依据,提高微调蒸馏的效率。
10 Superannotate.(2024)。Small Language Models(SLM)完全指南。
11 arXiv.(2025 年 2 月)。Adapt-Accel:面向 Small Language Model 的逐层自适应加速范式。arXiv:2502.03460。
12 Effective Altruism Forum.(2025)。量化对 Small Language Model(SLM)多语言数学推理能力的影响。
13 arXiv.(2025 年 7 月)。AI 暗战:SaaS 与边缘计算架构。arXiv:2507.11545。
14 DDN.(2025 年 6 月 20 日)。克服部署 AI 时面临的主要挑战。
15 A3Logics.(无日期)。部署 LLM 面临的挑战。
16 Coherent Market Insights.(2025 年 6 月)。设备端 AI 市场报告。
17 NVIDIA.(无日期)。ChatRTX GitHub Repository。
18 Built In.(2024 年 2 月)。什么是 Chat with RTX?
19 Apple Developer.(无日期)。Core ML。
20 GeeksforGeeks.(2025 年 7 月 23 日)。边缘计算的七大趋势。
21 Engiware.(2023 年 10 月 18 日)。Llama2 在 Mac M1 Max 上的广泛基准测试结果。
22 PowerInfer.ai.(无日期)。关于 PowerInfer。
23 arXiv.(2023 年 12 月)。PowerInfer:使用消费级 GPU 快速提供 Large Language Model 服务。arXiv:2312.12456。
24 arXiv.(2025 年 7 月)。以 Agent 为中心的经济:未来 AI 的结构性愿景。arXiv:2507.03904。
25 Xiatech.(无日期)。Composable AI。
26 Langbase.(无日期)。Composable AI。
27 Medium.(无日期)。面向 Web 的 Composable AI Agent:BaseAI 的模块化 AI 开发方法。
28 MuleSoft Blog.(无日期)。可组合性赋能 AI 的三种方式。
29 IBM Think.(无日期)。AI Agent 编排。
30 Salesforce.(无日期)。AI Agent 框架:实用指南。
31 Microsoft.(无日期)。AutoGen GitHub Repository。
32 Microsoft Research Forum.(2025 年 2 月 25 日)。AutoGen v0.4:重新构想 agentic AI 的基础。
33 Medium.(无日期)。深入 AutoGen 第 7 章:Core Agent 与 Runtime。
34 WordPress.(2025 年 3 月 4 日)。AutoGen v0.4:下一代 Agentic AI 完全指南。
35 instinctools.(2025 年 7 月 31 日)。AutoGen、LangChain 与 CrewAI 对比。
36 Composio Blog.(无日期)。OpenAI Agents SDK、LangGraph、AutoGen 与 CrewAI 对比。
37 IBM Think.(无日期)。流行的 AI Agent 框架。
38 LangChain.(无日期)。LangGraph。
39 LangChain.(无日期)。面向可靠 Agent 的平台。
40 arXiv.(2025 年 4 月 22 日)。Multi-Agent LLM 系统为何失败?故障模式的完整分类体系。arXiv:2503.13657。
41 arXiv.(2025 年 6 月)。面向 Agentic AI 的 TRiSM:信任、风险与安全管理框架。arXiv:2506.04133。
42 Tepper School of Business.(2025 年 2 月 12 日)。AI Agent 的伦理挑战。
43 Infosys BPM.(无日期)。AI 中的 Agent:伦理考量、问责与透明度。
44 IBM Think.(无日期)。Agentic AI 架构面临哪些主要挑战与风险?
45 CAPES.(无日期)。神经科学与 AI。
46 IMR Press.(无日期)。人脑架构,尤其是新皮质,如何启发人工智能的新方法?
47 arXiv.(2025 年 6 月 26 日)。Hierarchical Reasoning Model。arXiv:2506.2174。
48 ResearchGate.(2025 年 8 月 2 日)。Hierarchical Reasoning Model(HRM):一种受神经科学启发的……
49 Reddit.(无日期)。r/LocalLLaMA——HRM 解决的思考问题,比当前的“思考”模型更多。
50 Numenta.(2019 年 1 月 16 日)。智能的 Thousand Brains Theory。
51 Wikipedia.(2025 年 6 月 17 日)。Free Energy Principle。