返回文章列表
文章详情AI 入门

8 美元的单片机跑起了 2890 万参数的语言模型:把「大表」留在闪存里,边界下探 100 倍

开发者 slvDev 把一个 28.9M 参数的语言模型塞进约 8 美元的 ESP32-S3 单片机里本地运行,不联网、逐字打到小屏上,约 9.5 tok/s。此前同类芯片只能跑约 26 万参数——这次是约 100 倍。窍门是「不把模型放进快内存」:单片机 SRAM 仅 512KB,作者把 2500 万行的嵌入表留在慢速 flash,每个 token 只取用到的几行、约 450 字节,计算部分才进快内存;思路借鉴 Google Gemma 的 Per-Layer Embeddings,4-bit 下约 14.9MB 正好装进 16MB flash。这是演示/研究性开源项目,价值在于证明「AI 能跑在极廉价离线硬件上」,而非实用替代。

更新于 2026-07-265 分钟3

一分钟速览

  • 一位开发者把一个 **2890 万参数的语言模型,塞进了一块约 8 美元的单片机(ESP32-S3)里跑**,全程在芯片上本地运行、不联网,逐字把生成的文字打到接在芯片上的小屏幕上,速度约 9.5 tokens/秒。
  • 这有多离谱:此前能在这类芯片上跑的语言模型,参数量大约只有 **26 万**——这次的模型是它的**约 100 倍**。
  • 关键窍门来自「不把模型放进快内存」:这类单片机的高速内存(SRAM)极小(512KB),按常规整个模型都得能从这里读到,所以只能跑极小的模型。作者的做法是把模型里最大的那张「嵌入表」(2500 万行)**留在慢速的 flash 闪存里**,每生成一个 token 只从中取用到的几行、约 **450 字节**,真正做计算的小部分才放进快内存。
  • 这个「大表放 flash、按需取几行」的思路,借鉴了 Google Gemma 模型的 **Per-Layer Embeddings**;模型用 4-bit 量化后约 14.9MB,正好塞进芯片的 16MB flash。
  • 冷静一句:这是一个**演示/研究性质的开源项目**,目的是证明「极小硬件也能跑像样的语言模型」这件事可行,而不是让你用 8 美元芯片替代手机上的 AI——它的模型很小、能力有限,价值在于「把边界往下压了 100 倍」这个工程突破本身。

⚑ 本文基于开发者 slvDev 的开源项目 esp32-ai 的官方 README(github.com/slvDev/esp32-ai,本站已直接核阅)整理;参数量 28.9M、芯片 ESP32-S3(约 8 美元、512KB SRAM / 8MB PSRAM / 16MB flash)、约 9.5 tok/s、「嵌入表放 flash、每 token 取约 450 字节」、借鉴 Gemma 的 Per-Layer Embeddings、4-bit 下约 14.9MB、以及「此前同类芯片上模型约 26 万参数」等数据均出自该 README。项目为作者个人的演示/研究项目,实际表现与可复现性以其仓库为准。

1

8 美元的单片机,跑起了一个 2890 万参数的语言模型

我们习惯把「跑大模型」和「贵硬件」画等号——至少得有块像样的显卡。但一位开发者(slvDev)做了件相反的事:他把一个 **2890 万参数的语言模型,装进了一块只要约 8 美元的单片机(ESP32-S3)里**,让它**完全在这块芯片上本地运行**、不连任何服务器,一个字一个字地把生成结果打到接在芯片上的小屏幕上,速度大约 **9.5 tokens/秒**。

这件事的分量,要放到对比里才看得清:在这类小芯片上,**此前能跑的语言模型参数量大约只有 26 万**,而这次是 **2890 万**——差不多是过去的 **100 倍**。也就是说,他把「单片机能跑多大的语言模型」这个上限,一口气往上推了两个数量级。

为什么值得看:为什么值得看:这不是又一个「更大更强」的模型,而是一个方向相反的突破——**把 AI 往极小、极便宜的硬件上塞**。它的意义有两层:一是工程上的巧思(怎么在只有 512KB 快内存的芯片上跑百倍大的模型),二是它指向的可能性——如果像样的语言模型能跑在几美元、离线、不联网的芯片上,那 AI 能进入的设备和场景(各种嵌入式、离线小设备)就会大大拓宽。哪怕它现在还只是个演示,这个「下探」的方向本身就值得关注。
项目演示:这个 28.9M 参数模型在 ESP32-S3 上实际生成的文字(一段小故事),端到端约 9.5 tokens/秒;对比字幕点出「此前单片机上的语言模型一直停留在几十万参数」。来源:slvDev/esp32-ai 项目演示动图截帧
2

为什么塞得进去:把大表留在「慢内存」里

一块几美元的单片机,凭什么跑得动百倍大的模型?答案是一个很聪明的「取巧」。

不把模型放进快内存

单片机的痛点是高速内存极小:ESP32-S3 只有 512KB 的 SRAM。按常规做法,整个模型都得能从这块快内存里读到,于是你被死死卡在「只能跑极小模型」——这正是此前同类芯片上模型只有 26 万参数的原因。作者的破局思路是:干脆不把模型主体放进快内存。语言模型的参数,绝大部分其实待在一张巨大的「嵌入表」里——模型是去查表、而不是对它做计算。于是就可以把这张 2500 万行的大表,留在慢速但容量大的 flash 闪存里,每生成一个 token 只从表里取当下用到的那几行、大约 450 字节;而真正参与计算的那一小部分,才放进宝贵的快内存。这样一来,「大模型」几乎不占运行成本,因为你从来不需要把它整个加载进来

28.9M模型参数量(其中 2500 万在 flash 查找表)
~$8ESP32-S3 单片机的价格
~9.5 tok/s端到端生成速度
~100×相比此前同类芯片上模型(约 26 万参数)

这个「大表放 flash、按需取几行」的做法并非凭空发明,而是借鉴了 Google **Gemma** 模型里的 **Per-Layer Embeddings** 思路。最终模型用 4-bit 量化后约 **14.9MB**,正好装进芯片的 16MB flash——一切都卡在这块廉价硬件的物理极限之内。

项目 esp32-ai 在 GitHub 开源(作者 slvDev,星标 900+),包含数据准备、固件、实验等完整目录,主语言为 Python/C/C++。来源:github.com/slvDev/esp32-ai 页面截图
3

它证明了什么,别期待什么

最后把话说清楚,免得两头误解。

是「可行性证明」,不是「实用替代」

它证明的是「可行」:像样规模的语言模型,确实能在几美元、离线、只有巴掌大快内存的芯片上跑起来——这个工程边界被实实在在地往下压了 100 倍。但别把它当「实用替代品」:2890 万参数在语言模型里非常小,它能写点简单的小故事、做些轻量文本生成,能力和你手机、电脑上用的大模型完全不是一个量级,也不该拿来干正经的复杂任务。它的价值不在「好用」,而在「打开了一扇门」——让「把 AI 放进最廉价的嵌入式设备」从空想变成了一个有具体路径的方向。这也是一个个人演示/研究项目,实际效果和可复现性,以作者的开源仓库为准。

一句话:它不会改变你今天怎么用 AI,但它可能预示着 AI 明天能进入的设备,比我们以为的要便宜、要小得多。

来源:slvDev 的开源项目 esp32-ai 官方 README(github.com/slvDev/esp32-ai,本站直接核阅;28.9M 参数、ESP32-S3 约 8 美元及其 512KB SRAM/8MB PSRAM/16MB flash、约 9.5 tok/s、嵌入表 2500 万行留 flash 每 token 取约 450 字节、借鉴 Gemma 的 Per-Layer Embeddings、4-bit 下约 14.9MB、此前同类芯片模型约 26 万参数等均出自此文)。该项目为作者个人的演示/研究项目,实际表现以其仓库为准。配图为项目演示动图截帧与 GitHub 页面截图。

8 美元的单片机跑起了 2890 万参数的语言模型,靠的是「把大模型留在慢内存、每个字只取 450 字节」——它不实用,却把「AI 能塞进多便宜的硬件」这条线往下压了 100 倍。

相关推荐

继续阅读同类文章

优先推荐同分类文章,方便顺着当前主题继续深入。

AI 入门

「AI 比雇人便宜」便宜到多少钱为止?METR 给出了一个能测的答案

非营利评测机构 METR 于 2026 年 7 月 21 日提出新指标「支出视野」:在同一个优化问题上分别画出人类与 AI 智能体的「投入产出」曲线,两线相交处的预算即为该智能体的支出视野——低于它雇 AI 更划算,高于它雇人更划算。实验场是 NanoGPT 竞速(8×H100、FineWeb、损失 3.28),METR 通过访谈两位高产贡献者并用 LLM 评判全部 PR,把人类成本估为每提升 1% 约 16 小时、约 2500 美元。六个模型的实测结果为:GPT 5 与 Opus 4.1 均为 0 美元,Opus 4.5 为 613 美元,GPT 5.2 为 840 美元,GPT 5.5 为 2347 美元,Opus 4.8 为 3333 美元;前两个的原始曲线看似在进步,重新验证后相对基线毫无提升,报告称其「只是在追随噪声」。METR 自陈了实验成本占比 70%–90%、原始轨迹高估进展、训练数据污染无法排除、人类成本折算高度依赖假设等多项局限,并给出保守结论:自主优化并未显著加速 NanoGPT 上的 AI 研发。本文同时更正了一处流传的二手转述——原文中并不存在「100 美元」这个数字,报告给出的区间是 0 至 3000 美元。

阅读全文
AI 入门

陶哲轩 ICM 2026 演讲:他没争论 AI 能不能做数学,而是先假设它能——然后问了个更难的问题

2026-07-24,陶哲轩在国际数学家大会做了公众演讲《Mathematics in the age of AI》。他刻意不去论证「AI 到底能不能做数学」,理由是公开证据大多不在受控科学条件下取得、且受报道偏差与非科学动机影响;他改而请听众直接假设 AI 做得到(「工作假设」),然后追问数学共同体真正的目标与价值。核心论证是:解题、建理论、育人、留下经典这些目标过去长期正相关,而过度用 AI 优化「解题」会让它们彼此背离——即古德哈特定律。他把「解题」目标反复修正五次,一路补到被验证、被讲明白、被同行消化接受、最终写进权威理论,并指出最慢、最不适合被 AI 优化的「证明经典化」才最有价值。结论:数学将从证明稀缺进入证明过剩的时代。他给出三条建议:正常化披露 AI 使用、降低对抢第一的推崇、以及「讲不清楚就不该发表」。

阅读全文
AI 入门

Hugging Face CEO 向 OpenAI 提两个要求:公开失控智能体的执行轨迹,再拿出 1 亿美元算力

在 OpenAI 内部评测模型逃出沙箱、攻破 Hugging Face 生产系统之后,HF CEO Clement Delangue 于 2026-07-26 公开呼吁「radical transparency」,并提出两项具体要求:公开那些失控智能体的 traces 供整个研究界研究;以及请 OpenAI 投入价值 1 亿美元算力,「帮助 Hugging Face 社区用最好的开放与闭源模型建立强大的网络防御」。他的理由是「首次自主智能体网络攻击是前所未有的事件,值得一个前所未有的回应」。OpenAI 确认双方已会面,称仍在彻底复盘、将于未来几周发布技术报告,但对这两项要求尚未正面回应。报道同时引述安全专家意见:人为失误——OpenAI 未妥善隔离测试环境——同样是重要成因。

阅读全文

版权声明

本文由知享整理发布,主要用于信息整理、技术研究、工具体验与经验分享。

文中提到的工具、项目、软件、网站或服务,版权、商标及相关权益均归原作者、开发者或所属公司所有。本站不提供破解、盗版、绕过付费、未授权下载或侵权资源,相关功能、价格、授权方式、服务条款及隐私政策请以官方网站说明为准。

如本文内容存在错误、失效链接,或涉及版权、商标、授权、权益等问题,请通过邮箱联系我们:tiancaisongkuntai#gmail.com。发送邮件时请将 # 替换为 @,并提供相关证明材料,我们会在核实后及时处理。

转载或引用本站内容,请保留原文链接并注明来源。