成功在 4 台树莓派上运行 DeepSeek R1 Distill 8B,验证轻量级模型在边缘设备上的可行性。
通知 您必须登录才能更改通知设置
加载时出错。请重新加载此页面。
b4rtaz Feb 15, 2025 维护者
模型:deepseek_r1_distill_llama_8b_q40 版本:0.12.2
...
🔶 P 278 ms S 288 kB R 522 kB First
🔶 P 258 ms S 288 kB R 522 kB ,
🔶 P 323 ms S 288 kB R 522 kB I
🔶 P 275 ms S 288 kB R 522 kB need
🔶 P 293 ms S 288 kB R 522 kB to
🔶 P 269 ms S 288 kB R 522 kB understand
🔶 P 281 ms S 288 kB R 522 kB what
Evaluation
nBatches: 32
nTokens: 19
tokens/s: 7.70 (129.89 ms/tok)
Prediction
nTokens: 77
tokens/s: 3.54 (282.22 ms/tok)
⭕ Network is closed
...
🔶 P 162 ms S 864 kB R 1191 kB The
🔶 P 160 ms S 864 kB R 1191 kB Multi
🔶 P 157 ms S 864 kB R 1191 kB -
🔶 P 176 ms S 864 kB R 1191 kB Device
🔶 P 130 ms S 864 kB R 1191 kB In
🔶 P 174 ms S 864 kB R 1191 kB ference
🔶 P 132 ms S 864 kB R 1191 kB Cluster
🔶 P 172 ms S 864 kB R 1191 kB (
🔶 P 139 ms S 864 kB R 1191 kB MD
🔶 P 184 ms S 864 kB R 1191 kB IC
🔶 P 162 ms S 864 kB R 1191 kB )
🔶 P 156 ms S 864 kB R 1191 kB is
Evaluation
nBatches: 32
nTokens: 19
tokens/s: 11.68 (85.63 ms/tok)
Prediction
nTokens: 77
tokens/s: 6.43 (155.60 ms/tok)
⭕ Network is closed
回复:7 条评论 · 5 个回应
加载时出错。请重新加载此页面。
NetOpWibby Feb 15, 2025
加载时出错。请重新加载此页面。
danielfalbo Feb 15, 2025
加载时出错。请重新加载此页面。
dhenson02 Feb 19, 2025
你应该详细说明你是如何在多个设备上完成这个的
我很想读到或看到相关内容
加载时出错。请重新加载此页面。
加载时出错。请重新加载此页面。
感谢你展示你的结果。刚开始使用 dllama,看起来非常不错!我使用了 8 个节点(大多是较旧的 Intel CPU,4 或 6 核心,支持 AVX2),它们连接到一个 2.5G 局域网。我得到了这个结果:
...
🔶 P 60 ms S 2016 kB R 2342 kB less
🔶 P 56 ms S 2016 kB R 2342 kB ,
🔶 P 57 ms S 2016 kB R 2342 kB which
🔶 P 56 ms S 2016 kB R 2342 kB is
🔶 P 56 ms S 2016 kB R 2342 kB
🔶 P 62 ms S 2016 kB R 2342 kB 14
🔶 P 63 ms S 2016 kB R 2342 kB .
🔶 P 56 ms S 2016 kB R 2342 kB Got
🔶 P 84 ms S 2016 kB R 2342 kB that
🔶 P 63 ms S 2016 kB R 2342 kB part
🔶 P 56 ms S 2016 kB R 2342 kB down
🔶 P 56 ms S 2016 kB R 2342 kB .
🔶 P 56 ms S 2016 kB R 2342 kB Now
🔶 P 56 ms S 2016 kB R 2342 kB ,
Evaluation
nBatches: 32
nTokens: 11
tokens/s: 33.64 (29.73 ms/tok)
Prediction
nTokens: 245
tokens/s: 16.63 (60.13 ms/tok)
⭕ Network is closed
这是我使用的命令(v0.12.7):
./dllama inference --model models/deepseek_r1_distill_llama_8b_q40/dllama_model_deepseek_r1_distill_llama_8b_q40.m --tokenizer models/deepseek_r1_distill_llama_8b_q40/dllama_tokenizer_deepseek_r1_distill_llama_8b_q40.t --buffer-float-type q80 --nthreads 6 --max-seq-len 4096 --workers 192.168.0.151:9990 192.168.0.152:9990 192.168.0.153:9990 192.168.0.154:9990 192.168.0.155:9990 192.168.0.160:9990 192.168.0.161:9990 --prompt "What is 5 plus 9 minus 3?" --steps 256
加载时出错。请重新加载此页面。
你好 b4rtaz,你能告诉我评估和预测之间有什么区别吗
加载时出错。请重新加载此页面。
MengchiYang Sep 4, 2025
你是如何在 2 个树莓派 5(8GB)上成功运行它的?当我在这个配置下运行它时,工作节点显示 Listening on 0.0.0.0:9999... ⭕ The root node has connected ⭕ nNodes: 0 ⭕ NodeIndex: 0 ⭕ Socket[0]: accepted root node ⭕ Network is initialized 📀 RequiredMemory: 20474 MB 🧠 CPU: neon dotprod fp16 Killed
我在根节点上的命令是 ./dllama inference --model models/deepseek_r1_distill_llama_8b_q40/dllama_model_deepseek_r1_distill_llama_8b_q40.m --tokenizer models/deepseek_r1_distill_llama_8b_q40/dllama_tokenizer_deepseek_r1_distill_llama_8b_q40.t --buffer-float-type q80 --steps 16 --nthreads 4 --workers 192.168.1.100:9999
加载时出错。请重新加载此页面。
你需要降低上下文大小:--max-seq-len 4096
加载时出错。请重新加载此页面。
加载时出错。请重新加载此页面。
MengchiYang Sep 8, 2025
你知道为什么它只显示空白和点吗?
💡 RopeScaling: f=8.0, l=1.0, h=4.0, o=8192 📀 RequiredMemory: 3310 MB ⭕ Socket[0]: connecting to 192.168.0.105:9999 worker ⭕ Socket[0]: connected ⭕ Socket[1]: connecting to 192.168.0.106:9999 worker ⭕ Socket[1]: connected ⭕ Socket[2]: connecting to 192.168.0.108:9999 worker ⭕ Socket[2]: connected ⭕ Network is initialized 🧠 CPU: neon dotprod fp16 💿 Loading weights... 💿 Weights loaded 🚁 Network is in non-blocking mode ⭐ Chat template: deepSeek3 🛑 Stop: <|end▁of▁sentence|> 🛑 Stop: <|end▁of▁sentence|> 💻 System prompt (optional):
加载时出错。请重新加载此页面。
你使用的是什么版本?
加载时出错。请重新加载此页面。
我在 9 月 4 日克隆了这个仓库
加载时出错。请重新加载此页面。
你能拉取最后的更改吗?你是在什么样的 CPU 上尝试运行的?