前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
返回 AI 情报前线
All News · 全部资讯5417
  • Qwen Code 0.21.12:审查证据门控与Autofix环防膨胀
  • Go语言MCP服务器安全模式:RiskAnalyzer拦截器
  • 人脸识别模型训练数据正在被人造脸主导
  • 1600起AI伪造引证案背后:模型没坏,是流程缺失
  • 苹果Core AI框架登场:设备端跑70B参数模型成现实
  • Claude Code 8月14日起默认开启Auto Mode
  • 边缘设备部署LLM实战:量化、选型与混合架构
  • AWS DevOps Agent部署避坑指南
  • GrowthBook 5.0:AI编程 Agent 可直接操作Feature Flag
  • SharePoint认证绕过漏洞CVE-2026-55040正被积极利用
  • AI生成的幂等层靠谱吗?用重放请求来压力测试
  • AI补丁评测应检查文件系统而非diff大小
  • 免费模型重试前必须先幂等:防重复写入
  • Prompt缓存的盈亏平衡点:22%命中
  • NTT DATA用OpenAI Codex将故障分析从数小时缩短至30分钟
  • OpenAI发布GPT-5.6,主打性价比优于前代
  • SharePoint JWT认证绕过漏洞CVE-2026-55040爆发
  • TraceMotive v0.3:AI Agent 执行轨迹的结构化比对调试工具
  • OpenAI裁撤安全风险评估团队,安全工作分散至其他组
  • 让 AI Agent 发邮件前必须人工审批的工程实现
  • Cursor 修复命令注入漏洞后仍可被绕过(CWE-78)
  • LLM调用生产API的工程教训:别做快乐演示
  • 提示词与契约:让 AI 代理稳定执行的关键区别
  • LLM API 价格周刊:Qwen3.6 27B 生成价格降幅达44%
  • 生产支持新范式:AI Agent从告警到自动根因分析
  • Anthropic 生物武器过滤系统停摆近一年,1.33 亿请求未审查
  • 本地 LLM 显存实测:Q4 量化实际比标称重 23%
  • 10 分钟测试你的 AI Agent 是在推理还是背答案
  • AI 自动化 SEO 实验:Claude Code 每日一更的 42 周数据
  • 数据漂移排查:先查滚动条再查数据库
  • Google 开源 DESIGN.md:让 AI 编码工具读懂视觉规范
  • 4美元/月 DigitalOcean + vLLM 部署 Claude 3.5 Haiku 推理服务
  • 强到弱脚手架:推理时提升弱模型性能的新方法
  • 我用OKF、CLAUDE.md和Skills大幅降低LLMToken消耗
  • Gemini 3.7 Flash 与 Qwen3.8-27B 发布:编程能力大幅提升
  • 4.8万星开源项目:在浏览器里跑完整AI Agent流水线
  • 给编程Agent一个可复现的失败,而非模糊需求
  • 已加载 37 / 5417
8.0
热点
AI SCORE
技术实践2026-08-16 17:32

边缘设备部署LLM实战:量化、选型与混合架构

dev.to · AI#LLM部署#边缘计算#量化
Editor brief · 编辑速览

详细阐述了在边缘设备(树莓派到Jetson Orin)上部署LLM的完整流程,包括INT4/INT8量化、GGUF格式选择以及本地推理与云端协同的混合架构设计原则。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

理解边缘设备约束

边缘设备的范围很广,从配备 8GB 内存的 Raspberry Pi 5,到配备 64GB 内存的 NVIDIA Jetson AGX Orin 开发板。完整精度的 Llama 3 8B 模型大约需要 16GB VRAM,这直接排除了大多数嵌入式系统。量化是必不可少的。INT4 和 INT8 格式(包括 GGUF 和 ONNX 变体)可以将 7B 参数模型压缩到 4-6GB。即便如此,仅使用 CPU 的节点上推理速度通常低于每秒 5 个 token。你必须决定什么在本地运行,什么不在本地运行。

模型选择与量化

对于边缘部署,参数数量比跑分排名更重要。Qwen 2.5 7B、Llama 3.1 8B 和 Gemma 3 4B 等模型是常见的起点。使用 llama.cpp 进行跨平台 CPU 和 GPU 推理,或使用 ONNX Runtime 在 ARM 和 x86 边缘节点上进行优化执行。在 Apple Silicon 上,MLX 提供统一内存的高效推理。

示例:使用 llama.cpp 通过 Python 在本地运行量化模型。

from llama_cpp import Llama

# 加载一个 4-bit 量化的 Qwen 2.5 7B Instruct
llm = Llama(
    model_path="./qwen2.5-7b-instruct-q4_k_m.gguf",
    n_ctx=4096,
    n_threads=4,
    verbose=False
)

output = llm.create_chat_completion(
    messages=[{"role": "user", "content": "Summarize this sensor log."}]
)
print(output["choices"][0]["message"]["content"])

如果你的边缘硬件连 7B 模型都跑不动,可以考虑 3B 以下的选项,如 Phi-3 Mini 或 Qwen 2.5 3B。它们牺牲了推理深度,但对于分类和提取任务仍能保持响应速度。

部署框架与工具链

以下几个框架主导着边缘 LLM 部署:

llama.cpp:通用主力。支持 GGUF、CPU/GPU 混合卸载,运行于 Linux、macOS、Windows 和 iOS。

Ollama:将 llama.cpp 封装成简洁的 CLI 和 REST API。适合在边缘网关快速原型验证。

ONNX Runtime:当需要针对特定 NPU 或 DSP(如 Qualcomm Hexagon 或 Intel Movidius)时表现最佳。

TensorRT-LLM / TensorRT:在 NVIDIA Jetson 和独立边缘 GPU 上最大化吞吐量的必备工具。

vLLM:适用于有多 GPU 的微型数据中心边缘集群,尽管其内存开销较高。

对于容器化的边缘集群,用 Docker 打包这些运行时,通过 K3s 或类似的轻量级 Kubernetes 发行版进行编排。

混合云边架构

最具弹性的架构将边缘推理视为缓存,而非云端智能的替代品。本地模型处理低延迟、高频查询以及 PII 敏感的预处理。当任务需要长上下文分析、多步 agent 推理或大型多模态输入时,边缘节点应将请求转发至云端。云端模型返回结构化结果后,边缘节点可进行后续处理或缓存以备离线使用。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
Claude Code 8月14日起默认开启Auto Mode
下一篇
AWS DevOps Agent部署避坑指南