Hugging Face 2026 春季开源生态报告
Hugging Face 发布平台开源生态的季度数据报告,汇总趋势和热点项目信息
Hugging Face 发布平台开源生态的季度数据报告,汇总趋势和热点项目信息
本文延续了 2025 年年中开展的一项早期分析(可在此查看),该分析研究了 Hugging Face 社区正在构建什么。我们建议进一步阅读 Data Provenance Initiative、Interconnects、OpenRouter 和 a16z,以及 MIT 和 Linux Foundation 对 Hugging Face 内外开源生态系统的不同观察。由于 Hugging Face 生态系统是分布式的,因此这些分析结合了 Hugging Face 与社区成员的工作,并对每项工作进行了适当署名。
开源 AI 生态系统的活跃度迅速增长,用户数量、模型仓库数量和数据集仓库数量都接近翻倍。2025 年,Hugging Face 的用户数量增至 1,300 万,公开模型超过 200 万个,公开数据集超过 50 万个。这一增长不仅意味着人们对开源的兴趣日益浓厚,也反映出用户正转向主动参与:他们不再只是使用预训练系统,而是越来越多地创建微调模型、适配器、基准测试和应用等衍生产物。
数据来自 Hugging Face|Hugging Face 的 200 万个模型及持续增长:AI World 制作的图表与报道
该生态系统仍然高度集中。Hugging Face 上约有一半模型的总下载量不足 200 次,而下载量最高的 200 个模型——仅占模型总数的 0.01%——贡献了全部下载量的 49.6%。
围绕特定领域、语言或问题形成的专业社区,即使总体下载量不高,通常也会表现出持续的参与度和复用率。与其将开源 AI 理解为一个统一的市场,不如将其视为由多个相互重叠的子生态系统组成的集合。
越来越多的大型和小型公司正在基于开源进行构建。目前,超过 30% 的《财富》世界 500 强企业在 Hugging Face 上拥有经过验证的账户。初创公司经常将开放模型作为默认组件:Thinking Machines 的 Tinker 模型选项完全基于开放权重构建,而 VSCode 和 Cursor 等流行 IDE 同时支持开放模型和闭源模型。Airbnb 等美国成熟企业提高了对开放生态系统的参与度;在 2025 年期间,Hugging Face 也看到越来越多传统企业升级其组织订阅。
大型科技公司频繁在 Hugging Face Hub 上创建新仓库。将它们并列可视化后,仓库数量的强劲增长清楚地体现了其随时间不断增加的投入。其中,NVIDIA 已成为贡献最突出的公司。
数据来自 Hugging Face|大型科技公司全面押注开源 AI:AI World 制作的图表与报道
更广泛的开放软件研究表明,开放产物创造的下游价值远远超过其生产成本。类似的趋势正在 AI 领域出现:开放模型被数以千计的下游应用复用、调整和专业化。完全依赖闭源系统的组织通常需要承担更高的成本,同时在部署和定制方面面临更低的灵活性。
过去四年的历史累计下载量显示,在模型受欢迎程度方面,一些地区明显处于领先地位。美国和中国历来是主要贡献者,英国、德国和法国的受欢迎程度位居其后。由个人用户或没有明确地理归属的分布式组织开发的模型,约占整个平台下载量的一半。
数据来自 Hugging Face|图表与研究来自 Longpre 等人的《Economies of Open Intelligence: Tracing Power & Participation in the Model Ecosystem》
开源生态系统的地理构成已经发生根本性变化。Hugging Face 的数据显示,中国在月度下载量和总下载量方面均已超过美国。过去一年,中国模型迅速占据最大份额,贡献了 41% 的下载量。
数据与图表来自 Hugging Face
产业界在整体开发活动中的占比,从 2022 年以前的约 70% 降至 2025 年的大约 37%。与此同时,独立开发者或无组织归属的开发者在同期全部下载量中的占比从 17% 上升至 39%,某些时候甚至贡献了超过一半的总使用量。个人和小型团体专注于对基础模型进行量化、调整和再分发。如今,这些中间参与者在很大程度上决定了普通用户能够运行什么,以及创新如何在生态系统中传播。
数据来自 Hugging Face|图表与研究来自 Longpre 等人的《Economies of Open Intelligence: Tracing Power & Participation in the Model Ecosystem》
不同地区以不同方式作出贡献。美国和西欧历来通过大型产业实验室占据主导地位,包括 Google、Meta、OpenAI 和 Stability AI;而中国在模型发布和采用方面日益领先。法国、德国和英国继续通过研究机构、国家级 AI 计划和专业化模型家族作出贡献。能够支持多种贡献者和组织形式的生态系统,往往会产出采用范围更广的成果。
初创公司推出的热门模型分布更加广泛。具有竞争力的国家包括法国和韩国。值得注意的是,在开发新晋热门模型的主体中,排名第四的是个人用户,而不是组织。在个人用户层面创建具有竞争力的模型,已经比以往任何时候都更加容易。
数据与图表来自 Hugging Face
2025 年新创建的模型中,大多数热门模型要么由中国开发,要么衍生自中国开发的模型。最受欢迎的模型由大型组织开发,主要来自美国和中国。如需进一步了解中国 AI 生态系统,请阅读我们的三篇系列文章,回顾“DeepSeek 时刻”出现一年以来发生的变化:第一篇讨论战略变化,第二篇讨论架构变化,第三篇讨论组织与未来。
2025 年,在 DeepSeek 的 R1 模型于 1 月迅速走红后,中国 AI 生态系统大举转向开源。发布模型的中国竞争性组织数量,以及 Hugging Face 上的仓库数量都出现了爆发式增长。Baidu 在 2024 年没有在 Hub 上发布任何模型,到 2025 年发布量已超过 100 个。ByteDance 和 Tencent 的发布量分别增长了八至九倍。此前偏好闭源路线的组织,包括 Baidu 和 MiniMax,也明确转向开放发布。
数据与图表来自 Hugging Face
数量相近的美国热门组织长期以来一直稳定贡献着更多仓库。Meta 及其前身 Facebook 的研究组织贡献了相当大比例的开放发布成果,Google 的贡献程度稍低。
数据与图表来自 Hugging Face
将两者并列比较后可以看出,中国热门组织的仓库数量呈现陡峭的上升轨迹,这成为一个关键的战略差异。
数据与图表来自 Hugging Face
开源 AI 正日益与主权问题紧密相关。开放权重模型让政府和公共机构能够依据本国法律框架,使用本地数据对系统进行微调。能够部署在本国硬件上的模型,可以减少对外国控制的云基础设施的依赖。模型架构、训练过程和评估方面的透明度,则有助于监管审查和公共问责。可在此进一步阅读有关通过开源实现主权的内容。
在国家层面,各国政府正在采取行动。韩国于 2025 年年中启动“国家主权 AI 计划”,指定 LG AI Research、SK Telecom、Naver Cloud、NC AI 和 Upstage 为国家领军企业,负责开发具有竞争力的本土模型。2026 年 2 月,来自韩国的三个模型同时登上 Hugging Face Hub 热门榜。2026 年 3 月,韩国与美国初创公司 Reflection AI 宣布达成数据中心合作,同时将前沿开放权重模型引入韩国。
瑞士的 Swiss AI 计划以及欧盟资助的多个项目也体现了类似的优先方向。英国“公共资金,公共代码”的原则已经影响了多项政府支持的 AI 计划。
Hugging Face 热门页面,2026 年 2 月
对于拥有蓬勃发展的本土 AI 训练生态系统的国家而言,这些对开源 AI 和开放权重 AI 的投资已经开始产生回报。我们发现,模型和数据集通常在其开发地区使用得最多;开发者往往会选择最能代表其语言、并且符合相似技术与应用需求的模型。
数据与图表来自 Hugging Face
Hub 上获赞最多的模型反映了社区关注度,包括用户日后返回查看或引用该模型的意愿,以及模型的整体受欢迎程度。尽管这一指标并不总能反映实际使用情况,但长期积累的关注度可以释放兴趣信号。在一年之内,获赞最多的模型从以美国开发的 Meta Llama 家族为主,转变为更加国际化的组合,其中中国的 DeepSeek-R1 位居榜首。
数据与图示来自 Hugging Face
虽然科学贡献的价值可以通过多种指标来衡量,但我们 Hub 上的点赞功能表明,来自大型 AI 组织的论文获得了社区成员的广泛认可。值得注意的是,点赞最多的论文来自大型组织,主要来自美国和中国。排名前列的组织多数是中国科技大厂,其中字节跳动分享了大量高影响力的论文。
Space by Hugging Face | PaperVerse Explorer
在 Hugging Face 的《每日论文》精选集(由 Hugging Face 的 AK 策划)中,引用了模型和数据集创建工作的论文展现出最广泛的开源采用,总体上相当多样化。突出的发现表明医学论文影响力较大,而科技大厂的影响力相对较小。
Data from Hugging Face | Graphic and story by AI World
我们的社区成员选择如何在模型基础上构建——无论是通过微调、合并还是其他方法——反映了模型的受欢迎程度和可用性。作为一个组织,阿里巴巴拥有的衍生模型数量超过谷歌和 Meta 的总和,其中 Qwen 系列就包含超过 113,000 个衍生模型。如果包括所有标记为 Qwen 的模型,这个数字会增加到超过 200,000 个模型。
Data and Graph from Hugging Face
模型开发越来越重视可访问性和规模的平衡。小型模型的下载和部署速率远高于超大型系统,这反映了成本、延迟和硬件可用性的实际限制。
小型模型的主导地位部分原因是发布的模型更多。但即使进行归一化处理,ATOM 项目的相对采用指标数据显示,参数为 1-9B 的前 10 名模型的中位数下载量仅比 100B 以上的模型多约 4 倍。自动化系统和 CI 流水线进一步抬高了小型模型的下载计数,但向更小、可部署的模型发展的趋势是真实的。
Data from Hugging Face | Graph and Article by ATOM
用户对开源模型的参与度往往在发布后立即达到峰值,然后放缓。平均参与时长约为 6 周。持续改进和频繁更新已成为保持相关性的关键。DeepSeek 的连续发布(V3、R1、V3.2)即使在竞争对手出现时也保持了竞争力。开发停滞的组织往往会快速失去份额,而那些频繁更新或提供领域特定微调的组织会获得优势。
Data from Hugging Face | Graph and Research from Choksi et al. "The Brief and Wondrous Life of Open Models"
已下载开源模型的平均规模从 2023 年的 827M 参数增长到 2025 年的 20.8B,主要由量化和混合专家架构驱动。然而,中位数仅略有增加,从 326M 增至 406M 参数。这种差异表明高端 LLM 用户在拉高平均值,而小型模型的基础使用量保持稳定。
Data from Hugging Face | Graph and Research from Longpre et al. "Economies of Open Intelligence: Tracing Power & Participation in the Model Ecosystem"
前沿模型与较小系统之间的性能差异通常会通过微调和特定任务的适应快速缩小。在 Hub 上,拥有数亿参数的模型支持搜索、标记和文档处理工作流,而个位数十亿参数的模型广泛用于编码、推理和多模态任务。因此,大多数主要模型开发者现在发布涵盖各种规模的模型系列。具有能力的小型模型的崛起将自主权转向边缘,减少了对集中式云提供商的依赖。
开源 AI 开发与硬件发展趋势密切相关。大多数模型针对 NVIDIA GPU 进行了优化,但对 AMD 硬件的支持在不断扩展。Stability AI 模型集合现在针对 NVIDIA 和 AMD 两个平台进行了优化。越来越多的库同时支持两者,工具也得到了改进,使跨硬件部署变得更加直接。2025 年,Hugging Face 推出了 Kernel Hub,用于加载和运行针对 NVIDIA 和 AMD GPU 优化的内核。
同时,中国开源模型正在发布,并明确支持本土开发的芯片。阿里巴巴已投资推理为主的芯片架构,旨在为中国数据中心配备能够本地运行开源模型的硬件。
虽然访问计算资源对于 AI 模型的开发和部署仍然是核心必需品,但开源和开放权重模型正在帮助打破一个将其视为终极解决方案的生态系统。越来越多的各种性能水平的模型相比最大开发者的旗舰 AI 模型实现了 10 倍到 1000 倍的成本降低和效率提升。
Data and Graphic from Hugging Face
不过,开源基础设施投资的问题仍然迫在眉睫。为能够训练和提供开源模型的数据中心提供公共资金已成为一个不断增长的政策讨论话题,特别是在欧洲和英国。大型闭源模型公司可用的计算资源与开源社区可访问的资源之间的差距继续影响开源开发中的可行性。
机器人学已成为 Hugging Face 增长最快的子社区之一。数字令人瞩目:机器人学数据集从 2024 年的 1,145 增长到 2025 年的 26,991,在短短三年内从排名 44 跃升为 Hub 上最大的数据集类别。相比之下,排名第二的文本生成类别在 2025 年仅有约 5,000 个数据集。
Data from Hugging Face | Graph and Story by AI World
社区贡献的数据集涵盖从家务操纵任务到自动驾驶的所有内容。最大的空间智能多模态数据集 Learning to Drive (L2D) 通过 LeRobot 与 Yaak 的合作发布。像 RoboMIND 这样的数据集拥有超过 107,000 条真实世界轨迹,涵盖 479 项不同的任务和多个机器人体现,提供了训练可泛化机器人策略所需的规模和多样性。
Hugging Face 收购 Pollen Robotics,向工业、学术实验室以及普通爱好者开放了开源机器人技术。LeRobot 是 Hugging Face 的开源机器人库,提供基于 PyTorch 的真实机器人模型、数据集和工具,涵盖模仿学习、强化学习和视觉语言行动模型,实现了快速增长。在过去一年中,其 GitHub 仓库星标数几乎增加了三倍。
Data from GitHub | Graphic from star-history.com
科学研究已成为另一个特别活跃的领域。开源模型和数据集越来越多地用于蛋白质折叠、分子动力学、药物发现和科学数据分析。所有前沿 AI 公司现在都拥有专门的科学团队,尽管目前大部分关注仍集中在文献发现而非直接实验。
Space by Hugging Face | Science Release Heatmap
社区主导的项目围绕共同的研究目标而形成,通常涉及来自不同机构和学科的数百名贡献者。这些努力突出了开源作为协调大规模跨学科工作的机制的作用,这种工作通过传统的学术或企业结构单独组织会很困难。
开源 AI 生态系统通过全球参与、技术专业化和机构采用的结合而继续演变。几个趋势可能会定义下一阶段。
地理权力的重新平衡正在加速。西方组织越来越多地寻求商业可部署的中国模型替代品,这为 OpenAI 的 GPT-OSS、AI2 的 OLMo 和 Google 的 Gemma 等努力创造了紧迫性,以提供来自美国和欧洲开发者的有竞争力的开源选项。这些努力是否能与 Qwen 和 DeepSeek 的采用势头相匹敌将是 2026 年的一个关键问题。
机器人学和科学子社区的增长表明,开源 AI 正在从语言和图像生成扩展到物理和实验领域。围绕文本和图像模型开发的基础设施、规范和协调机制正在适应新的模态和用例。
对于研究人员、开发者、公司和政府来说,开源仍然是构建、评估和治理 AI 系统的基础层。随着 AI 智能体部署的增加,开源及其互操作性将成为智能体蓬勃发展的关键。过去一年的轨迹表明了一件事:开源生态系统是 AI 开发、适应和部署的许多实际工作发生的地方,其对更广泛的 AI 格局的影响在继续增长。
感谢 Hugging Face 社区持续为 AI 生态系统奠定基础 🤗
如果您想引用本博客文章,可以使用以下 BibTeX:
@misc{hf_state_of_os_spring26,
author = {Avijit Ghosh and Lucie-Aimée Kaffee and Yacine Jernite and Irene Solaiman},
title = {State of Open Source on Hugging Face: Spring 2026},
booktitle = {Hugging Face Blog},
year = {2026},
url = {https://huggingface.co/blog/huggingface/state-of-os-hf-spring-2026},
}
本作者的更多文章
Building Moon Bot: A Slack-Native Coding Agent Backed by HuggingFace Buckets
Introducing Serge: GitHub-Native AI Code Review
· 登录或注册以发表评论
本文提及的数据集 1
本文提及的 Spaces 4
本文提及的 Collections 2