一分钟速览
- 一位开发者把一个 **2890 万参数的语言模型,塞进了一块约 8 美元的单片机(ESP32-S3)里跑**,全程在芯片上本地运行、不联网,逐字把生成的文字打到接在芯片上的小屏幕上,速度约 9.5 tokens/秒。
- 这有多离谱:此前能在这类芯片上跑的语言模型,参数量大约只有 **26 万**——这次的模型是它的**约 100 倍**。
- 关键窍门来自「不把模型放进快内存」:这类单片机的高速内存(SRAM)极小(512KB),按常规整个模型都得能从这里读到,所以只能跑极小的模型。作者的做法是把模型里最大的那张「嵌入表」(2500 万行)**留在慢速的 flash 闪存里**,每生成一个 token 只从中取用到的几行、约 **450 字节**,真正做计算的小部分才放进快内存。
- 这个「大表放 flash、按需取几行」的思路,借鉴了 Google Gemma 模型的 **Per-Layer Embeddings**;模型用 4-bit 量化后约 14.9MB,正好塞进芯片的 16MB flash。
- 冷静一句:这是一个**演示/研究性质的开源项目**,目的是证明「极小硬件也能跑像样的语言模型」这件事可行,而不是让你用 8 美元芯片替代手机上的 AI——它的模型很小、能力有限,价值在于「把边界往下压了 100 倍」这个工程突破本身。
⚑ 本文基于开发者 slvDev 的开源项目 esp32-ai 的官方 README(github.com/slvDev/esp32-ai,本站已直接核阅)整理;参数量 28.9M、芯片 ESP32-S3(约 8 美元、512KB SRAM / 8MB PSRAM / 16MB flash)、约 9.5 tok/s、「嵌入表放 flash、每 token 取约 450 字节」、借鉴 Gemma 的 Per-Layer Embeddings、4-bit 下约 14.9MB、以及「此前同类芯片上模型约 26 万参数」等数据均出自该 README。项目为作者个人的演示/研究项目,实际表现与可复现性以其仓库为准。
8 美元的单片机,跑起了一个 2890 万参数的语言模型
我们习惯把「跑大模型」和「贵硬件」画等号——至少得有块像样的显卡。但一位开发者(slvDev)做了件相反的事:他把一个 **2890 万参数的语言模型,装进了一块只要约 8 美元的单片机(ESP32-S3)里**,让它**完全在这块芯片上本地运行**、不连任何服务器,一个字一个字地把生成结果打到接在芯片上的小屏幕上,速度大约 **9.5 tokens/秒**。
这件事的分量,要放到对比里才看得清:在这类小芯片上,**此前能跑的语言模型参数量大约只有 26 万**,而这次是 **2890 万**——差不多是过去的 **100 倍**。也就是说,他把「单片机能跑多大的语言模型」这个上限,一口气往上推了两个数量级。

为什么塞得进去:把大表留在「慢内存」里
一块几美元的单片机,凭什么跑得动百倍大的模型?答案是一个很聪明的「取巧」。
单片机的痛点是高速内存极小:ESP32-S3 只有 512KB 的 SRAM。按常规做法,整个模型都得能从这块快内存里读到,于是你被死死卡在「只能跑极小模型」——这正是此前同类芯片上模型只有 26 万参数的原因。作者的破局思路是:干脆不把模型主体放进快内存。语言模型的参数,绝大部分其实待在一张巨大的「嵌入表」里——模型是去查表、而不是对它做计算。于是就可以把这张 2500 万行的大表,留在慢速但容量大的 flash 闪存里,每生成一个 token 只从表里取当下用到的那几行、大约 450 字节;而真正参与计算的那一小部分,才放进宝贵的快内存。这样一来,「大模型」几乎不占运行成本,因为你从来不需要把它整个加载进来。
这个「大表放 flash、按需取几行」的做法并非凭空发明,而是借鉴了 Google **Gemma** 模型里的 **Per-Layer Embeddings** 思路。最终模型用 4-bit 量化后约 **14.9MB**,正好装进芯片的 16MB flash——一切都卡在这块廉价硬件的物理极限之内。

它证明了什么,别期待什么
最后把话说清楚,免得两头误解。
它证明的是「可行」:像样规模的语言模型,确实能在几美元、离线、只有巴掌大快内存的芯片上跑起来——这个工程边界被实实在在地往下压了 100 倍。但别把它当「实用替代品」:2890 万参数在语言模型里非常小,它能写点简单的小故事、做些轻量文本生成,能力和你手机、电脑上用的大模型完全不是一个量级,也不该拿来干正经的复杂任务。它的价值不在「好用」,而在「打开了一扇门」——让「把 AI 放进最廉价的嵌入式设备」从空想变成了一个有具体路径的方向。这也是一个个人演示/研究项目,实际效果和可复现性,以作者的开源仓库为准。
一句话:它不会改变你今天怎么用 AI,但它可能预示着 AI 明天能进入的设备,比我们以为的要便宜、要小得多。
来源:slvDev 的开源项目 esp32-ai 官方 README(github.com/slvDev/esp32-ai,本站直接核阅;28.9M 参数、ESP32-S3 约 8 美元及其 512KB SRAM/8MB PSRAM/16MB flash、约 9.5 tok/s、嵌入表 2500 万行留 flash 每 token 取约 450 字节、借鉴 Gemma 的 Per-Layer Embeddings、4-bit 下约 14.9MB、此前同类芯片模型约 26 万参数等均出自此文)。该项目为作者个人的演示/研究项目,实际表现以其仓库为准。配图为项目演示动图截帧与 GitHub 页面截图。
8 美元的单片机跑起了 2890 万参数的语言模型,靠的是「把大模型留在慢内存、每个字只取 450 字节」——它不实用,却把「AI 能塞进多便宜的硬件」这条线往下压了 100 倍。


