Redis 作者 antirez 发布,基于 Metal 框架在 Mac M 系列芯片上原生运行 MiniMax-H3 模型,实现本地文生视频/音频,无需云端 API。
Salvatore Sanfilippo——更广为人知的名字是 antirez,Redis 的作者——刚刚发布了 H3-Metal,一个面向 Apple Silicon 的原生 MiniMax-H3 推理引擎。它可以在你的 Mac GPU 上完整运行一个多模态 AI 模型(文生视频和文生音频),无需云端 API,无需服务器往返,数据永远不会离开你的机器。
对于关注本地 AI、隐私保护或边缘计算未来的人来说,这是一件大事。
H3-Metal 是 MiniMax-H3 的原生 Metal 实现——MiniMax-H3 是一个多模态模型,能够根据文本提示生成视频和音频。该项目建立在 Apple Metal 框架之上的一系列可工作的垂直切片实现,直接访问 M 系列芯片上的 GPU。
这里的关键词是原生。它不是围绕 Python 模型的封装层,也不是翻译层。它是一个 C 实现,直接与 Metal 通信,将模型权重映射到统一内存,并在 GPU 上运行推理。结果是快速、内存高效、完全自包含的。
根据项目的 README,H3-Metal 支持:
<Picture 1>、<Picture 2> 等)。交互模式尤其巧妙。你可以输入提示,用 !seed random 或 !seconds 2 这样的命令调整设置,会话将模型的条件信息保留在内存中,因此重复提示速度很快。
就隐私而言:每个提示都留在你的机器上。没有数据发送到云端 API。对于敏感应用场景——医疗、国防、受 NDA 约束的创意工作——这决定了能否使用 AI。
就成本而言:云端视频生成 API 价格昂贵。每个视频都要花钱。使用 H3-Metal,成本就是你现有的 Mac 的功耗。如果你已经拥有一台 M 系列 Mac,推理基本上是免费的。
就延迟而言:没有网络往返意味着更快的迭代。交互式会话将模型保留在内存中,所以更改种子并重新生成几乎是瞬间完成的。
就开源生态而言:这证明了原生的、非 Python 的 AI 推理是可行的。Python ML 生态很强大,但也很重。直接运行在 Metal 上的 C 实现更精简、迭代更快,在资源受限的环境中更容易部署。
H3-Metal 包含几种优化技术:
--layers 45 只运行 50 个 transformer 块中的 45 个,以质量换取速度和内存。--reuse 2 计算 11 个全新的去噪器速度,而不是全部 20 个,对跳过的过渡进行外推。首次运行需要支付模型加载和文件系统缓存的成本。后续运行会明显更快。该项目专门针对 M3 Max 和 M5 Max,并正在进行持续的 Metal 性能优化。
H3-Metal 是迈向原生 AI 推理的众多努力的一部分。我们看到:
模式很清楚:AI 推理正在从纯云端走向本地优先。工具越来越好用,模型越来越小,硬件越来越快,本地推理对于实际用例已经变得可行。
目前,H3-Metal 面向开发者和折腾派。你需要:
但方向是对的。如果一个独立开发者(antirez,独自工作)能为一个最先进的开源多模态模型构建原生 Metal 推理引擎,那么本地 AI 的门槛正在快速下降。再过一两年,这类工具就会有图形界面、预设库和一键安装程序。
Salvatore Sanfilippo 有打造可用之物的记录。Redis 改变了整个行业对数据结构的看法。他对 H3-Metal 的方法是典型的务实风格:用垂直切片构建,让每个切片都能工作,然后发布。
README 读起来像个教程,因为它本身就是个教程——antirez 公开构建,记录每一步。这使得 H3-Metal 不仅是一个工具,还是一个学习资源,适合任何对 AI 推理在 Metal 层面实际上如何工作感兴趣的人。
H3-Metal 代表了一件重要的事:AI 推理的民主化。不是通过计量你使用量并收集你数据的云端 API,而是通过在你已有的硬件上运行的原生代码。
一位开发者构建了这个——一个完整的多模态模型原生运行在 Apple Silicon 上,支持交互式会话、参考条件化和性能优化——这个事实表明,本地 AI 的未来比想象中更近。云端 API 时代不会结束,但它不再是唯一的选择。
H3-Metal 是开源的,发布在 github.com/antirez/h3.c。