AI模型走向专业化分工的趋势分析
Hugging Face讨论通用AI模型向特定领域专业化发展的必然性,及其对模型架构和训练的影响。
Hugging Face讨论通用AI模型向特定领域专业化发展的必然性,及其对模型架构和训练的影响。
优化理论、进化生物学、竞争性市场和机器学习都做出了怎样的预测——以及为什么它们给出的答案完全相同
关注 Dharma AI 的读者已经知道,我们将专业化视为构建高效 AI 系统的决定性原则之一。从成本和性能,到可靠性和自主可控,这一原则影响着系统的方方面面。鲜有论文能像 Goldfeder、Wyder、LeCun 和 Shwartz-Ziv 在 2026 年发表的研究那样,严谨地阐明这一观点。
本文将探讨并解读《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》(Goldfeder、Wyder、LeCun 与 Shwartz-Ziv,2026)中的观点。该论文从优化理论、生物学、组织经济学和机器学习等多个领域论证了殊途同归的结论,为下文的讨论提供了证据框架和思想基础。本文的论述视角、组织结构和编辑性综合则由 Dharma 完成。
传统预期并非没有道理:随着 AI 系统的能力不断增强,它们的通用性也应该随之提高。更强的能力和更广的适用范围看起来理应相伴而生——更多资源、更优方法和更广泛的训练,应该能让系统以越来越高的把握应对更多任务。
然而,实际呈现出的规律并非如此。在任何特定领域中取得最显著成果的系统,往往都是最专注于该领域的系统。蛋白质结构预测领域的突破,来自一个专为单一科学任务设计的系统。仔细审视 AI 发展史上的里程碑便会发现,它们体现的是对特定领域的高度聚焦,而非通用性的不断扩展。
这一规律反复出现。它跨越不同领域、不同年代,也跨越几乎毫无共同点的架构选择。如此稳定一致的规律,暗示着某种共同原因——而这一原因根本不源于 AI 研究本身。
1997 年,Wolpert 和 Macready 证明了一个很少出现在 AI 架构讨论中的结论:不存在任何一种通用优化算法,能够在所有可能的问题上胜过其他所有算法(Wolpert 与 Macready,1997)。这是数学证明,而非哲学论断。对学习器可能面对的每一个可设想问题取平均值后,所有算法的表现都同样好——也同样差。一种算法在某一问题分布上获得的优势,必然意味着它会在其他问题分布上有所退让。性能只是被重新分配,而非凭空增加。
其实践含义非常直接:“算法之所以胜出,是因为它与目标问题高度适配”(Goldfeder 等,2026)。这一定理并不是说通用性不可能实现,而是说通用性并不构成性能优势。持续获得超越性表现的结构性路径,是集中投入:以覆盖广度换取适配程度。
将有限资源纳入考量后,这一结论会更加鲜明。任何现实系统都受制于各种约束——算力有限、数据有限、开发时间有限。在能量有限的情况下,将可用资源用于学习有限任务集合的方法,会优于把相同资源分散到无限任务范围的方法。这里的算术关系毫不留情:随着任务集合无限扩张,每项任务能够分配到的资源将趋近于零。在资源有限的前提下,全面覆盖与具有实际意义的性能之间存在直接矛盾。
这一定理所指向的结论并不是通用性不好,而是一个范围更窄、也更具可操作性的判断。正如论文所述:“普适的通用性是一个理论概念,但从实践角度来看,它只是一个神话”(Goldfeder 等,2026)。真正能够经受现实约束考验的,不是试图包办一切的系统,而是与自身目标高度适配的系统。
数学将这一点确立为一种预测,而非偏好。至于这种预测在优化理论之外的现实世界中是否依然成立,则是另一个问题。
在优化理论为这一预测赋予名称之前,另外两个领域就已经得出了相同的结论。
论文对生物学论据的描述是:在一个生态位中获得的每一项性能提升,都会在其他地方付出代价。通才具备适应多种环境的特征,却无法在任何一种环境中达到最优——其能力分散得过于稀薄,因而无法在任何特定条件下占据主导地位。不存在不伴随权衡取舍的性能提升;投入某项能力的资源,将无法再用于其他能力。自然选择偏爱与局部条件相匹配的设计,而非为了均匀覆盖所有可能环境而优化的设计。能够生存并繁衍的生物,并不是综合能力最强的生物,而是与特定环境最为匹配的生物。经过漫长的进化积累,最终结果并不是通才占据主导地位,而是专家型物种填满各个生态位。正如论文所述:“专业化并非生物学中的偶然现象,而是有限资源、相互竞争的目标,以及只奖励应对少部分与进化相关挑战的表现之下,可以预见的结果”(Goldfeder 等,2026)。
竞争性市场通过不同的方式遵循着相同的动态规律。无法达到性能门槛的组织和策略会被淘汰——不是通过物种灭绝,而是通过退出市场、资金中断,以及被适配程度更高的替代方案取代。竞争是一种选择机制:它会放大有效策略并淘汰无效策略。这种机制与生物选择毫无共同之处——没有遗传、没有突变,也不存在进化尺度的时间跨度。选择的单位不是生物,而是组织、产品和策略。然而,它们承受的结构性压力是相同的:有限的资源、明确的性能要求,以及对那些资源分布过于宽泛、因而无法在关键领域脱颖而出的实体进行系统性淘汰。当性能标准清晰且稳定时,集中式能力会在竞争中胜过分散式能力。
进化和市场通过完全不同的机制运作——时间尺度不同、选择单位不同、继承机制也不同。然而,在资源压力下,两者都会产生相同的结果:适配胜过广度。定理预测了这一点,生物学和市场则各自独立地得出了这一结论。当第三个领域又通过完全不同的方式得到相同发现时,这种规律看起来就不再仅仅是一条定理,而开始显现为受约束系统运行方式中更为普遍的特征。
同样的规律也出现在机器学习内部——它并非从优化理论推导而来,而是人们在不断构建系统、观察哪些因素能够改善系统的长期实践中逐渐发现的。
其中最清晰的表现形式是负迁移:当一个系统接受多任务训练时,如果这些任务彼此竞争而非相互协作,系统性能就会出现可测量的下降(Ruder,2017)。当任务共享某些结构时,联合训练会有所帮助。但当任务争夺表征容量,或者在训练过程中产生相互冲突的梯度时,各项任务的性能就会低于专用系统所能达到的水平。覆盖广度带来的收益,转化成了深度上的代价。这是将有限容量分配给彼此对抗的任务所产生的、已有文献记录的后果。专业化系统不存在这种竞争,因此也无须承担这一代价。
前沿模型的架构提供了另一种形式的证据。混合专家系统并不是通过让全部参数具备均匀一致的通用性来获得广泛能力,而是将每个输入路由至网络中的一个专业化子集——针对不同任务激活不同的专家。论文作者将其解读为一种结构性让步:一个以通用性为设计目标的系统,通过在内部重新引入专业化而取得实际成果。这是一种有论据支持的解读,而非经过证明的定理——这些架构的设计初衷是提高计算效率,因此,它们对于通用性局限的启示是一种合理推论,而不是设计者明确表达的意图。但这一点仍然值得注意:能力最强的通用系统,正是通过在内部执行专业化系统从设计之初便会执行的操作,才达到了相应的性能。
最清晰的历史案例也遵循同样的逻辑。AlphaFold 通过专注于蛋白质结构预测这一特定任务,并采用针对该任务的架构和训练方案,实现了该领域的跨越式进步(Jumper 等,2021)。它的进步来自更聚焦的专注,而非更广泛的覆盖。论文将 AlphaFold 作为一个典型案例——不是为了证明所有专业化系统都能取得同等幅度的提升,而是将其视为对这一机制极为清晰的说明。这种机制已经反复出现:论文指出,AI 发展史上的里程碑往往体现的是对特定领域的高度聚焦,而非广泛能力,即便相关成果看起来像是在展示通用智能。
三个截然不同的领域。三种不同的机制。相同的发现。
如果不讨论 AI 研究中最常被引用的观察之一,这幅图景便是不完整的。Sutton 的“苦涩的教训”(Bitter Lesson)指出,依赖领域知识的方法始终会被扩展计算规模的方法超越(Sutton,2019)。从表面上看,这似乎让支持专业化的论点变得复杂:如果规模和通用性终将胜出,那么专业化或许只是在资源受限时有用的一种启发式策略,而随着算力成本降低,这些限制也会逐渐缓解。
这一质疑混淆了两个截然不同的概念。领域知识是指手工编码的特征、人工设计的先验,以及旨在让系统理解某个特定领域的规则。“苦涩的教训”针对的正是这些做法——而且这样做是正确的。随着规模扩大,编码了显式领域知识的系统始终会被其他系统超越。
领域专业化则有所不同:它是指决定将系统的资源、架构和训练聚焦于一组范围有限的任务,而不是将它们广泛分散到各类任务中。这并不是将某个领域的知识编码进系统,而是对系统作用范围的选择。
论文准确地区分了二者:
“领域知识的效用不断降低,与领域专业化是否有用是两回事。随着规模化不断推进,我们在构建蛋白质折叠系统时,需要了解的蛋白质知识将越来越少;然而,这样的系统仍会因专门聚焦于蛋白质而受益。”(Goldfeder 等,2026)
规模化改变的是系统可以从数据中学到什么。它并不会改变这样一个事实:将资源集中在有限的任务集上,是否会优于把资源分散到无限广泛的任务范围中。“苦涩的教训”和专业化论点讨论的是两个不同的维度——前者描述知识应如何获取,后者描述系统应以什么为目标。二者完全可以同时成立。规模化改变了系统学习的机制,却不会消除那项使适配性比广度更有价值的约束。
在四种分析传统中,同一种模式经由不同路径浮现出来。这并不是一个需要解释的巧合,而是证据本身。
当有限资源遭遇选择压力时——无论是在优化问题、生态系统、市场还是一次训练运行中——适配性都会持续胜过广度。具体机制不同,时间尺度不同,选择单位也不同。但其结构性动力完全相同,并会产生相同的结果。
这一定理并不是生物学中这种模式的成因。生物学也不是市场中这种模式的成因。二者同样都不是机器学习中这种模式的成因。它们面对的是相同的底层约束:在资源稀缺的情况下追求性能,就必须有所集中。这一定理从数学上确立的规律,得到了进化史的实证验证、竞争市场的制度性展示,以及机器学习在架构层面的重新发现。
专业化并非一种偏好,而是有限资源遭遇性能要求时必然涌现的结果。
如果你正在评估领域聚焦会如何影响组织中的 AI 性能,或者正在内部论证专业化战略,我们希望了解你的具体情况。欢迎联系 Dharma AI。
Goldfeder, S., Wyder, M., LeCun, Y., & Shwartz-Ziv, R. (2026). AI 必须通过超人级自适应智能拥抱专业化。arXiv:2602.23643。
Wolpert, D.H. & Macready, W.G. (1997). 优化中的“没有免费午餐”定理。IEEE Transactions on Evolutionary Computation, 1(1), 67–82。
Wolpert, D.H. & Macready, W.G. (1997). 优化中的“没有免费午餐”定理。IEEE Transactions on Evolutionary Computation, 1(1), 67–82。
Forister, M.L., Novotny, V., Panorska, A.K., Baje, L., Basset, Y., Butterill, P.T., & Dyer, L.A. (2012). 植食性昆虫食性广度的全球分布。Proceedings of the National Academy of Sciences, 109(2), 418–423。
Forister, M.L., Novotny, V., Panorska, A.K., Baje, L., Basset, Y., Butterill, P.T., & Dyer, L.A. (2012). 植食性昆虫食性广度的全球分布。Proceedings of the National Academy of Sciences, 109(2), 418–423。
Futuyma, D.J. & Moreno, G. (1988). 生态专业化的进化。Annual Review of Ecology and Systematics, 19, 207–233。
Futuyma, D.J. & Moreno, G. (1988). 生态专业化的进化。Annual Review of Ecology and Systematics, 19, 207–233。
Hannan, M.T. & Freeman, J. (1977). 组织的种群生态学。American Journal of Sociology, 82(5), 929–964。
Hannan, M.T. & Freeman, J. (1977). 组织的种群生态学。American Journal of Sociology, 82(5), 929–964。
Loasby, B.J. (1983). 知识、学习与企业。引自 Goldfeder 等(2026)。
Loasby, B.J. (1983). 知识、学习与企业。引自 Goldfeder 等(2026)。
Ruder, S. (2017). 深度神经网络多任务学习综述。arXiv:1706.05098。
Ruder, S. (2017). 深度神经网络多任务学习综述。arXiv:1706.05098。
Fedus, W., Zoph, B., & Shazeer, N. (2022). Switch Transformer:通过简单高效的稀疏机制扩展至万亿参数模型。Journal of Machine Learning Research, 23(120), 1–39。
Fedus, W., Zoph, B., & Shazeer, N. (2022). Switch Transformer:通过简单高效的稀疏机制扩展至万亿参数模型。Journal of Machine Learning Research, 23(120), 1–39。
Jumper, J., Evans, R., Pritzel, A., Green, T., Figurnov, M., Ronneberger, O., & Hassabis, D. (2021). 使用 AlphaFold 进行高精度蛋白质结构预测。Nature, 596, 583–589。
Jumper, J., Evans, R., Pritzel, A., Green, T., Figurnov, M., Ronneberger, O., & Hassabis, D. (2021). 使用 AlphaFold 进行高精度蛋白质结构预测。Nature, 596, 583–589。
Silver, D., Hubert, T., Schrittwieser, J., Antonoglou, I., Lai, M., Guez, A., & Hassabis, D. (2018). 一种通过自我对弈掌握国际象棋、将棋和围棋的通用强化学习算法。Science, 362(6419), 1140–1144。
Silver, D., Hubert, T., Schrittwieser, J., Antonoglou, I., Lai, M., Guez, A., & Hassabis, D. (2018). 一种通过自我对弈掌握国际象棋、将棋和围棋的通用强化学习算法。Science, 362(6419), 1140–1144。
Sutton, R.S. (2019). 苦涩的教训。取自 http://www.incompleteideas.net/IncIdeas/BitterLesson.html
Sutton, R.S. (2019). 苦涩的教训。取自 http://www.incompleteideas.net/IncIdeas/BitterLesson.html
专业化胜过规模:大多数 AI 采购决策所忽视的战略变量——本文在实证与战略层面的姊妹篇。“没有免费午餐”定理确立了为什么从结构上可以预见专业化,而这篇文章则考察了专业化在实践中表现更优的证据,以及为什么大多数 AI 采购决策仍未给予它足够重视。
专业化胜过规模:大多数 AI 采购决策所忽视的战略变量——本文在实证与战略层面的姊妹篇。“没有免费午餐”定理确立了为什么从结构上可以预见专业化,而这篇文章则考察了专业化在实践中表现更优的证据,以及为什么大多数 AI 采购决策仍未给予它足够重视。
文本退化:大多数基准测试并未追踪的生产环境故障模式——一种已有记录的故障模式,会在语言模型超出其有效领域边界运行时出现。
文本退化:大多数基准测试并未追踪的生产环境故障模式——一种已有记录的故障模式,会在语言模型超出其有效领域边界运行时出现。
超越聊天机器人的直接偏好优化——偏好优化技术如何扩展到对话式 AI 之外的专业领域;这是本文所论证的、在结构上必然出现的领域聚焦战略的一种具体实现。
超越聊天机器人的直接偏好优化——偏好优化技术如何扩展到对话式 AI 之外的专业领域;这是本文所论证的、在结构上必然出现的领域聚焦战略的一种具体实现。
在 Hugging Face 上探索 Dharma AI,体验我们的交互式演示、下载我们的开源模型,并了解专业化 AI 系统如何在真实的企业应用中超越通用模型。
该作者的更多文章
GPU 管理:为什么闲置 GPU 是新时代停飞的飞机
模型更新,优势依旧
我想补充的是,在 AI 智能体时代,部署一个领域极其狭窄、所需提示词和上下文更少的新型高度专业化智能体,将会减少幻觉和 token 消耗。这种方式成本低廉且便捷,因此在我看来,它是最有可能的发展路径。
核心论点——专业化优于通用性——是(请原谅我)显而易见的事实。我确实赞赏领域知识和领域专业化之间的区分。它们不是同一个维度,混淆它们是一个常见的错误。遗憾的是,作者在事情变得有趣的地方停止了。领域知识的价值增益被描述为随着规模增加而递减,没有说明下限。专业化的价值增益被描述为持续存在;不是增长,只是不像知识那样被侵蚀。这是一条衰退线对比平线,而不是两个东西以不同速度向同一方向移动。作者从未说过衰退在哪里停止,或何时停止投资专家内容会停止有回报——相比之下仅是缩小范围。这种关于什么是专业化的精确区分应该对何时停止追求知识、开始追求专注有精确的说明。多少才够?10,000 小时(按 Malcolm Gladwell 的说法)?
很好的观点,我同意这是讨论变得最有趣的地方。
不可能说衰退在哪里触底,因为神经网络通过叠加学习表示,而不是将单个神经元或子网络分配给特定的领域。换句话说,不可能隔离网络的部分并声称它们负责领域 X 或 Y,因为这些领域通过重叠表示编码。我们可以确认的是,这取决于知识库中领域广度与模型参数数量之间的关系(参数越多,保留知识的容量就越大)。要回答这个问题,我们需要某种方式来衡量训练数据中包含的领域知识量,以及这些领域在高度非线性神经网络学习的隐含空间中的重叠程度。我相信这个问题目前是无法解决的。
关于投资专业内容何时停止带来回报的问题,我认为这只在目标是构建一个真正更通用目的的模型时才会发生。如果目标是使用可用资源(参数)跨广泛主题提供浅层响应,那么在具有广泛覆盖但每个领域深度相对较浅的数据集上训练会更有意义。另一方面,如果目标是构建解决有限且相对较小的一组任务的模型,更专业化的数据永远是更好的选择。自然地,随着任务集规模的增加,你最终会回到想要通用模型的第一种情景。
相同的推理适用于我们何时应该追求更大专注的问题:只要应用的范围本身是专注的。这从根本上是一个设计选择。如果你正在为可能接收任何类型输入的开放式任务训练模型,拥有一个跨许多主题浅层响应的模型比只深入响应少数几个主题的模型更好。相反,如果应用有明确定义的范围,总是更好地为该范围训练专业化的模型,更高效地利用其资源,而不是将资源花费在永远不会需要的知识上。
也就是说,这些是非常相关的问题,我们希望至少通过机制可解释性来解决其中的一部分,这是我们研究与开发工作中的一个研究领域。该领域的技术使我们能够观察模型内的内部电路、稀疏使用的神经元、在特定条件下激活的神经元和其他内部机制。这可能帮助我们更好地理解模型如何在内部工作,并更直接地回答你的一些问题。
· 登录或留言评论