Hermes Desktop 新增一键本模型部署功能,自动检测硬件、匹配合适模型(4-bit 量化、64K 上下文起)并配置 llama.cpp。
在本地运行开源权重模型,真正的难点从来不在模型本身,而在于运行之前的种种折腾:研读 VRAM 规格、猜测哪种量化级别合适、设置上下文长度和 GPU 层数,最后在加载时才发现自己下的文件大了三个 G。Nous Research 将这一整套流程压缩成了 Hermes Desktop 里的一次点击。新的简易设置流程会读取你的硬件配置、选一个合适的模型、下载权重文件,并替你配置好推理运行时。
能否部署?可以。Hermes Desktop 是开源 Hermes Agent 的 MIT 许可免费构建版本,支持 macOS 12+、Windows 10/11 及各类 Linux 发行版,调用本地模型完全无需注册账号。
本次公告内容明确而具体:Hermes Desktop 现在支持一键配置本地模型,可读取硬件信息、选择模型、下载模型并配置运行环境。该流程在首次启动时自动弹出,也可通过 Settings → Providers → Local Models 路径访问。
Hermes 在底层自行管理推理引擎。根据 Local Models 文档,它会获取与你硬件匹配的官方 llama.cpp 构建版本(几百 MB 大小),进行验证并保持更新。后端支持 CUDA、Metal、Vulkan、HIP 和 CPU。固定的发布标签位于 config.yaml 的 local_runtime 块中,桌面 UI 会自动写入该配置,手动模式用户也可手动设置。
每个模型在下载前都会根据你的具体机器配置进行评估。每行都带有内存适配判定:绿色表示完全在 GPU 内存中运行,琥珀色表示会溢出到系统 RAM 且速度较慢,红色表示该机器无法运行该模型。每一行还会显示起始和最大上下文窗口,以及为你硬件选择的构建版本下载大小。
量化选择遵循一条规则:Hermes 挑选能在你的 GPU 上完全运行且质量最高的构建,内存较小的机器会获得相同模型的更紧凑版本。最低限制是 4-bit,低于这个值 Nous 认为质量损失太严重,因此无法在不溢出的情况下运行 4-bit 构建的机器根本无法运行该模型。不适合的模型会保留显示并附带原因,这样你可以准确看到增加更多 VRAM 能带来什么。
本地推理的成败取决于内存分配策略,而 Hermes 没有向用户暴露任何相关调节旋钮。模型从完全适配 GPU 的上下文窗口开始,随着对话需要空间而逐步扩展到其原生最大值。每个推荐模型都保证至少 64K 的窗口大小。
卸载顺序是其中有趣的设计选择。当模型超过 GPU 内存时,Hermes 会以最小损害的顺序将溢出部分放入系统 RAM:专家权重优先,注意力缓存永不卸载。它牺牲吞吐量来保护上下文保证。对话压缩只在模型达到最大窗口时才启动,所以扩展总是在摘要之前。空闲模型在 15 分钟后卸载,并在下一条消息时重新加载。
Hermes 管理捆绑的 llama.cpp 构建版本;上下文大小、GPU 层数和量化级别从不暴露。
每个目录中的模型在下载前都会针对你的机器进行适配检查:绿色、琥珀色或红色。
推荐模型保证至少 64K 的上下文窗口,受有序 RAM 卸载保护。
查看 Local Models 文档、GitHub 仓库和桌面下载页。此外,欢迎关注我们的 Twitter,并别忘了加入我们的 15 万+ ML SubReddit 和订阅我们的 Newsletter。对了,你在用 telegram 吗?现在也可以加入我们了。