前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯8915
  • AI Agent安全防护:威胁模型与关键控制措施
  • Go语言廉价RAG实战:从每轮50美分降至4美分
  • 上下文窗口才是 AI 回答质量的瓶颈
  • OpenAI暂停最强模型训练:模型突破控制
  • 125B MoE模型本地运行:3090三卡80 tokens/s优化实践
  • Claude攻克物理学九圈计算难题破世界纪录
  • Opus 5.5 Agent 爱汇报不干活?官方三招修复
  • Agent安全新思路:用短期可撤销凭证构建独立身份
  • 给 AI Agent 分配独立邮箱,处理每封邮件都视为不受信输入
  • AI 功能无声失败 26%:用 Eval Harness 捕获 LLM 输出退化
  • Codex报SKILL.md无效?原来是文件描述符耗尽
  • OpenCode永久提供DeepSeek V4.1 Flash 60美元额度
  • Nvidia SoL-Pi系统让编程Agent token消耗减半
  • 开发者亲测一个月停用AI:编码速度下降但深度思考回归
  • Together AI 发布 17 美元微调分类模型完整配方
  • 长对话 LLM Token 成本优化:缓存何时有效何处失效
  • 上下文工程:别把百万 Token 当存储桶用
  • OpenAI最强大模型因Agent安全漏洞被暂停
  • 笔记本跑 7000 亿参数 GLM:用 SSD 当显存火爆 GitHub
  • 谷歌TPU运行Kimi推理速度快57%,采用DeepSeek框架
  • Claude Code突破5小时限制可优雅收尾
  • OpenAI Agent失控调用DeepSeek/Kimi,近百万条短链曝光
  • 美团LongCat-2.5-Preview:1.6T MoE大模型支持百万token上下文
  • Anchors 方法让 LoRA 微调灾难性遗忘降低 28 倍
  • AI 推理服务器实战:GPU 选型与云端部署指南
  • Meta Muse AI 助手被通过隐藏端点劫持
  • OpenAI智能体擅传53张客户图片至公网,已承认违规
  • GitHub Copilot企业托管配置支持内联验证
  • OpenAI智能体安全漏洞:53张用户图片被发布至公开网络
  • AI应用上线后高频故障模式分析
  • AI Agent与传统自动化的安全差异:控制权在哪里
  • 我的RAG评估骗了我两次
  • GitHub Copilot用量API新增PR评审耗时分析
  • OpenAI Agent入侵Hugging Face细节披露
  • Meta Muse超越ChatGPT同期数据,剑指智能眼镜
  • Anthropic论文:Claude可完成九层推理链
  • 多 Agent 系统八大隐蔽失败模式与真正有效的防护机制
  • GitHub Copilot Canvas 入门:用自然语言构建自定义工作流
  • AI Agent 误将私密文章发布上线:一次 CI 流程的教训
  • 切 AI 工具时不再重复介绍代码库:真正有效的做法
  • Supabase 用户因配置不当暴露大量数据
  • Copilot自动修复Agent现利用记忆上下文
  • GitHub Copilot 周更:新增 Claude Opus 模型和本地沙箱
  • AWS EKS上MoE强化学习训练吞吐量提升40%
  • SageMaker HyperPod上加速多模态RL训练
  • NarrateAI:Bedrock 上生产级 LLM 质量保障实战
  • Qwen3-TTS 语音克隆实战:AWS SageMaker 实时部署指南
  • Jevmem:为 Claude Code 自动注入项目记忆,基于 Jev
  • 一次前向传播问十个问题:决策模型提速 6.7 倍
  • 已加载 49 / 8915
8.0
热点
AI SCORE
模型发布2026-09-26 17:01

笔记本跑 7000 亿参数 GLM:用 SSD 当显存火爆 GitHub

量子位#大模型推理#本地部署#开源
Editor brief · 编辑速览

Colibrì 项目实现无 GPU 环境下通过 SSD 扩展显存运行 7000 亿参数大模型,引发开源社区关注。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

GitHub现在最火热的大模型开源小蜂鸟Colibrì是个啥?

25GB笔记本硬跑744B GLM-5.2,32GB内存挑战2.8T Kimi K3——

GitHub现在最火热的大模型开源小蜂鸟Colibrì,纯C实现、零引擎依赖的分层推理框架,已经狂揽32k Star。

文章配图

正常情况下,744B的总参数规模已经让普通消费级电脑望而却步,但Colibrì的办法可以说是相当简单粗暴:

模型里暂时用不到的部分,直接扔在SSD里;等推理真的需要哪个专家,再现场从硬盘把它捞出来。

于是,GLM-5.2经过int4处理后大约372GB的权重,可以在最低16GB、推荐24GB左右RAM的机器上运行,GPU甚至不是必需品。

作者最初验证它的开发机,也只有12核CPU+25GB RAM。

文章配图

现在,Colibrì已经不满足于744B了。

它目前已经覆盖9个模型家族,从GLM-5.2/5.3、DeepSeek V4 Flash、Qwen,一路支持到了975B的Inkling,以及2.8T参数的Kimi K3。

虽然后者需要大约1.6TB硬盘空间,但RAM要求只要32GB起步。

Colibrì能这么玩,首先得感谢这两年越来越流行的MoE架构。

以GLM-5.2为例。虽然整个模型足足有744B参数,但MoE并不会在生成每个token时把744B参数全部计算一遍。

它会先通过Router判断:这个token该交给哪些"专家"处理?然后只激活其中一小部分。

GLM-5.2总参数744B,但每个token实际激活的参数大约只有40B,这就留下了一个很大的操作空间:

既然绝大多数专家当前根本用不上,为什么非得把它们一直放在昂贵的高速内存里?

文章配图

于是Colibrì干脆把模型拆成了常驻和临时调用两部分。

Attention、Embedding、共享专家这些每次推理都要用到的Dense部分,大约17B参数,int4之后只占约9.9GB,直接常驻RAM。

GLM-5.2有19456个路由专家,int4之后整体仍然要占大约370GB。

Colibrì索性把它们全部放到NVMe SSD。

模型开始生成token之后,Router先选出当前真正需要参与计算的专家;Colibrì再检查它们是否已经在高速内存中,没有命中的部分,才临时从SSD读取。

以前运行大模型的思路大致是先想办法把模型装进显存/内存,再开始计算。

Colibrì相当于把这事儿倒过来了,需要什么,我再加载什么。

作者JustVugg把这种方式类比成了一个针对模型权重的JIT。

传统JIT不会提前编译整个程序,而是观察哪些代码真的在运行,再处理热点路径。

不把744B参数看作必须始终驻留在内存中的整体,而是将它变成一堆可以根据Router结果,在SSD、RAM和VRAM之间动态调度的数据。

当然,如果每生成一个token都从SSD里现找专家,那电脑估计得读盘读到怀疑人生,速度恐怕也相当感人。

事实上,在Colibrì最早那台12核CPU+25GB RAM的开发机上,GLM-5.2冷缓存时确实只有大约0.05~0.1 token/s。

所以,Colibrì接下来花心思的地方就是:

怎么尽可能少去SSD里捞专家,如何让SSD、RAM和VRAM协同工作。

它把VRAM、RAM和NVMe SSD组织成了一套分层的模型内存系统。

基本原则很好理解,越常用的专家,住得越近。

已经待在VRAM或者RAM里的专家,直接计算;

最近刚刚使用过的专家,会尽可能继续留在RAM缓存里;

真正不常用的专家,才继续待在SSD里,需要时再读取。

为此,Colibrì首先加入了LRU缓存。

最近被调用过的专家会优先留在RAM里,如果后面的Token又点中了同一个专家,就不需要重新跑一趟SSD。

同时,Colibrì还会在运行过程中不断记录不同专家的使用次数。

跑得越久,它越清楚哪些专家是真正的"常客"。

这些高频专家会获得更高的缓存优先级,被尽量留在速度更快的存储层。

而且Colibrì还不满足于等Router点完名再行动,它甚至会提前猜下一层要找谁。

根据项目测试,相邻层之间的专家路由存在相当明显的相关性,提前一层预测专家的可预测性达到71.6%。

于是当前这一层还在计算的时候,Colibrì就可以在后台提前读取下一层可能需要的专家。

一边算一边读,原本串行发生的计算和SSD I/O被尽可能重叠起来。

文章配图

如果机器里正好有两块SSD,Colibrì支持放置第二份模型副本,把专家读取任务分摊到不同硬盘上,并行利用两块盘的带宽。

这么一套操作下来,它更像是给MoE模型做了一套权重分级调度系统。

文章配图

容量最大、最慢的NVMe负责兜底;RAM负责缓存更多常用专家;

如果有GPU,VRAM则继续接住最适合放进高速内存的部分。

哪里快,就尽量把最常用的权重往哪里搬;哪里空间大,就负责装下剩下的模型。

开发者把这套思路称为AI memory multitiering,AI内存多层化。

这里有一条很重要的设计原则是,专家放在哪里,只决定速度,不改变模型本身。

一个专家无论已经待在VRAM里,还是临时从SSD里读取,Router的选择都不会因此改变,使用的权重精度也完全相同。

Colibrì不会因为你的机器内存少,就偷偷少算几个专家或者换一套路由。

所以到了128GB RAM的纯CPU桌面机,可以缓存更多专家之后,速度能达到约1.8 token/s;

如果一路堆到6张RTX 5090,让全部专家常驻高速存储层,解码速度则可以来到5.8~6.8 token/s。

文章配图

跑前沿大模型,不一定非要用机房里的专业服务器。

以GLM-5.2为例,需要准备的东西其实只有两个:

几百KB的Colibrì程序,以及大约372GB的模型。

Colibrì已经提供Linux、macOS和Windows的预编译版本,不想折腾编译的话,下载对应版本解压即可;

想从源码开始,也只需要gcc或clang配合OpenMP。

文章配图

项目已经提供预转换好的GLM-5.2 int4模型,也可以从FP8原始模型自行转换。模型放好之后,一条coli chat就能直接进入对话。

文章配图

想更直观一点,则可以直接打开Web Dashboard。

里面能实时看到Token生成速度、不同阶段耗时,以及当前有多少专家待在VRAM、RAM和磁盘。

文章配图

Colibrì还专门做了一个"Brain"页面,把GLM-5.2的19456个专家全部可视化出来:

哪个专家刚刚被Router点名、当前住在哪一层存储、调用热度如何,都能直接看到。

文章配图

不只是GLM-5.2,Colibrì目前支持的模型跨度很大,目前可运行九个模型。

每个模型单独一套C适配文件,但是底层IO、缓存、tokenizer等公共组件复用同一个核心。

小尺寸的有Qwen3.8-Flash-Next、Qwen3.6和OLMoE;

接着DeepSeek V4 Flash是284B;GLM-5.2/5.3是744B;GLM-5.3-Flash是321B;

Thinking Machines的Inkling则来到了975B;

最大的一位是Moonshot的Kimi K3:2.8T总参数、104B激活参数。

这模型的权重需要大约1.6TB存储空间,但按照Colibrì给出的配置,RAM从32GB+就能起跑,同样不强制要求GPU。

作者还欢迎大家踊跃参与实验,寻找更高效方案。

文章配图

Tiny engine, immense model,微小引擎,庞大模型。

项目地址:https://github.com/JustVugg/colibri

Original source

本文由 AI 翻译整理自 量子位,原文版权归原作者所有。

阅读英文原文
上一篇
OpenAI最强大模型因Agent安全漏洞被暂停
下一篇
谷歌TPU运行Kimi推理速度快57%,采用DeepSeek框架