ESP32-S3(8美元微控制器)通过per-layer嵌入技术,在14.9MB Flash上量化运行28.9M模型,达9.88 tok/s交互速度,较此前记录提升百倍。
2026 年 7 月 25 日,一个名为 esp32-ai 的仓库登上了 Hacker News 头条。听起来像个笔误: 一个 2890 万参数的语言模型,完全运行在 ESP32-S3 上——一块大约 8 美元的单片机,有 512KB SRAM,更常见的用途是在智能插座里闪烁 LED。不是从服务器流式推流。不是 offload 到手机。就在芯片上生成文本,速度 9.88 tokens 每秒,大约是你阅读的速度。
不到一周,Tom's Hardware、The Register、Adafruit 和 CNX Software 都做了报道。此前的 ESP32 语言模型纪录大约是 26 万参数。这次在同类硬件上大了 100 倍,达到了交互式速度。真正发生变化的东西——不是芯片。
关键在于内存,而非算力
这块 ESP32-S3 有三层存储:512KB 高速 SRAM、8MB 较慢的 PSRAM、以及 16MB Flash。 一个 2890 万参数的模型量化为 4 位需要约 14.9MB——塞进 Flash 没问题,但 Flash 太慢, 每个 token 都要从中流式读写权重就完全不可行。为此,开发者(ID 为 slvDev)从 Google 的 Gemma 3n 借鉴了一个思路:逐层嵌入(per-layer embeddings)。
背后的洞察是:小模型的参数大部分集中在嵌入表里,而嵌入是查表操作,不是矩阵运算。 所以架构把模型一分为二。一个大约 56 万参数的密集推理核——真正每步都在做计算的那部分——放在 RAM 里。 其余 2500 万参数作为内存映射查表表放在 Flash 里,生成一个 token 只需要访问其中约 6 行:大约 450 字节的 Flash 读取。 芯片永远不需要同时拿到整个模型;它只需要一小片,而且它精确知道是哪一片。
SRAM 存放激活值和归一化权重,PSRAM 存放核心网络和输出头,Flash 存放嵌入表。 这是精妙的系统工程——真正的突破在于内存层次结构,而非更快的处理器。这个谱系也很重要: 几乎每个单片机 LLM 移植都可以追溯到 Andrej Karpathy 的 llama2.c,一个单文件 C 推理引擎, 以及 DaveBben 的 esp32-llm,后者于 2024 年证明了一块 26 万参数的模型可以在同类芯片上跑出 19 tokens 每秒。 两年间从 26 万到 2890 万,驱动力就是一个架构思路。
几乎没人注意到的那一个
这里才是没有任何头条的部分。2026 年 8 月 5 日,一个 ID 为 cyfrit 的开发者在 Hacker News 发了一个叫 p-for-llm 的项目。 得了 2 分就沉了。它不应该被淹没。
p-for-llm 在一块 ESP32-P4 上运行一个 1.809 亿参数的 mixture-of-experts 模型——12 层,每层 29 个 expert,top-1 路由, BitNet 风格的三元量化,词表从 Qwen 裁剪而来。开发板售价 6 到 10 美元。生成速度约 9 tokens 每秒, 能遵循简单 ChatML 格式的指令,甚至有一个早期的 tool-calling 演示——作者坦诚地描述为"经常跑偏"。 需要诚实标注的星号:权重在启动时通过 USB 推送到板子上——约 44MiB 分散在 Flash 和 PSRAM 中—— SD 卡自主运行列为未来工作。作者用单块消费级 GPU 在约 120 亿个 token 上训练的。
如果 esp32-ai 证明了一块单片机可以容纳一个语言模型,p-for-llm 是第一个暗示单片机可能容纳一个 有用 的语言模型的迹象。 为完整性起见,还有第三个前沿:esp32s3-distributed-ai 将一个 5600 万参数的模型分片到三块 ESP32-S3 板上, 通过 ESP-NOW 无线协议以 250 字节数据包通信。很粗糙——目前只演示了约 30 个连贯词——但这是一个花一块披萨的钱就能搭起来的真正分布式推理集群。
ESP32 上"LLM"的四个层级
搜索"ChatGPT on ESP32",你会淹没在无数演示里。几乎没有一个是它们看起来的样子。 截至 2026 年 8 月,这个领域的所有项目都属于四个层级之一,而区别至关重要:
第一层——真正的设备端运行。 模型的权重和计算都在单片机上。esp32-ai 是旗舰案例。 这是困难的事情。
第二层——设备端计算,流式权重。 芯片做数学运算,但权重从主机传来——p-for-llm 的 USB 加载, 或者 wifi-llm 实验,通过 WiFi 将一个 16MB 模型逐层流式传输到 300KB 可用 RAM 中。真正的推理,只是连着脐带。
第三层——分布式单片机。 多块板子各自持有一个分片,通过无线传递激活值。早期,有趣,但目前大多还是研究玩具。
第四层——接了云的麦克风。 ESP32 录制音频,发送到 OpenAI 或 Gemini 或 Qwen,再播放回答。 你看过的那些精致的"ESP32 AI 助手"视频几乎都是这个模式——值得注意的是,这也描述了乐鑫自己的官方 ESP LLM 解决方案, 明确是云端推理。没毛病。只是别把它和前三层混为一谈。
还有一个值得破除的迷思:没有任何 ESP32 芯片有 NPU。S3 和 P4 上的 AI 加速是一组 SIMD 向量指令, 而乐鑫最新芯片——自 2026 年 7 月量产以来的 ESP32-S31——在射频和 SIMD 上加码,而不是神经网络硬件。 乐鑫的芯片路线图赌的是单片机将成为 LLM 客户端。业余爱好者持续证明它们可以成为 LLM 主机。 这种张力是嵌入式计算领域目前最有趣的故事之一。
所以你实际能做什么?
坦诚时刻,因为大部分报道都跳过了这一点。S3 上那个 2890 万模型是在 TinyStories 上训练的: 它写简短的、大多连贯的儿童故事,而且只做这件事。它不能回答问题、遵循指令或查找事实—— 它的创造者说得清清楚楚。瓶颈不在内存技巧;而是 56 万参数的推理核能推理的程度就那么多。 一篇病毒帖将它与 OpenAI 第一个 GPT 的四分之一按参数数量相比,这是真的但也是误导性的——参数不等于能力。
今天的第二层硬件真正支持的是:离线故事生成器、互动徽章和玩具、新奇打字机、环境文本艺术—— 任何"可爱比正确重要"的场景。核心约束是 PSRAM(标准 S3 上 8MB,P4 板子上 32MB)和 Flash, 且 4 位或三元量化是必须的。与此同时配角阵容其实很优秀:ESP32-S3 上的唤醒词检测已是生产级别(已集成在 Home Assistant 中), 2700 万参数的语音识别模型现在已超越同体量的 Whisper 变体。一个全离线语音管道的各个部件正在一块不到一顿午餐价格的硬件上汇聚。
而趋势才是关键。目前在用的每一种技术——逐层嵌入、三元量化、expert 路由、跨内存层次的权重分层—— 都是为大模型发明的,正在被向下移植。"写可爱故事"和"有用的助手"之间的差距大约对应 2890 万到几亿参数, 而 p-for-llm 刚刚展示了 1.809 亿是可以塞进去的。
这就是 Edge 的意义
这篇文章开启 Edge,这是 The AI Vibe 的一个新板块,关注 AI 在最小机器上的运行—— 一个Newsletter 风格的信息流,呈现单片机和边缘 AI 领域的真实进展,外加动手测试日志。 我已经订购了开发板:计划是自己跑这些项目,测量实际的 tokens 每秒而不是引用 README, 然后在这里(和视频里)发布结果。在这个领域工作的人们——slvDev、cyfrit、DaveBben、wladimiravila, 以及所有 Karpathy 的 llama2.c 的下游——正在当前 AI 领域做一些最具创意的系统工程, 在其他所有人都忽视的硬件上。他们值得这些认可,也值得被用复现来审视。两者都会来。