6.0
关注
AI SCORE
技术实践2023-09-07 22:36
M2 Ultra单机运行180B超大模型
Hacker News · twitter.com#Apple#大模型优化
Editor brief · 编辑速览
突破消费级硬件限制在Mac上部署超大模型,展示了模型优化的极限,但实际应用场景有限。
突破消费级硬件限制在Mac上部署超大模型,展示了模型优化的极限,但实际应用场景有限。
Georgi Gerganov@ggerganov 在 M2 Ultra 上随意运行 180B 参数的 LLM 00:00–2:26 PM · 2023 年 9 月 7 日 683.3K 次浏览 743 个赞 683.7K 个转发 856 条回复
Georgi Gerganov@ggerganov 2023 年 9 月 7 日 使用的是 Q4_0 量化模型 - 约 100GB 磁盘大小 原始生成 - 即没有推测解码 尝试用 Falcon 7B 作为草稿模型会很有意思
76 个回复 196 个赞 3.3K 次转发
nisten🇨🇦e/acc@nisten 2023 年 9 月 7 日 呃,我能仅用 CPU 运行它,只需要 4GB RAM,速度是每秒 1.18 个 token,哈哈 🤯。完整输出如下:
➜ llama.cpp git:(fix_opencl_mat_mul) ✗ ./build/bin/main -m ~/falcon-180b-chat.Q4_K_M.gguf -t 19 -e -n 500 -p "Building a Show more
192 个回复 933 个赞 11.2K 次转发
加入对话 阅读另外 72 条回复