返回文章列表
文章详情AI 入门

8 美元的单片机跑起了 2890 万参数的语言模型:把「大表」留在闪存里,边界下探 100 倍

开发者 slvDev 把一个 28.9M 参数的语言模型塞进约 8 美元的 ESP32-S3 单片机里本地运行,不联网、逐字打到小屏上,约 9.5 tok/s。此前同类芯片只能跑约 26 万参数——这次是约 100 倍。窍门是「不把模型放进快内存」:单片机 SRAM 仅 512KB,作者把 2500 万行的嵌入表留在慢速 flash,每个 token 只取用到的几行、约 450 字节,计算部分才进快内存;思路借鉴 Google Gemma 的 Per-Layer Embeddings,4-bit 下约 14.9MB 正好装进 16MB flash。这是演示/研究性开源项目,价值在于证明「AI 能跑在极廉价离线硬件上」,而非实用替代。

更新于 2026-07-265 分钟3

一分钟速览

  • 一位开发者把一个 **2890 万参数的语言模型,塞进了一块约 8 美元的单片机(ESP32-S3)里跑**,全程在芯片上本地运行、不联网,逐字把生成的文字打到接在芯片上的小屏幕上,速度约 9.5 tokens/秒。
  • 这有多离谱:此前能在这类芯片上跑的语言模型,参数量大约只有 **26 万**——这次的模型是它的**约 100 倍**。
  • 关键窍门来自「不把模型放进快内存」:这类单片机的高速内存(SRAM)极小(512KB),按常规整个模型都得能从这里读到,所以只能跑极小的模型。作者的做法是把模型里最大的那张「嵌入表」(2500 万行)**留在慢速的 flash 闪存里**,每生成一个 token 只从中取用到的几行、约 **450 字节**,真正做计算的小部分才放进快内存。
  • 这个「大表放 flash、按需取几行」的思路,借鉴了 Google Gemma 模型的 **Per-Layer Embeddings**;模型用 4-bit 量化后约 14.9MB,正好塞进芯片的 16MB flash。
  • 冷静一句:这是一个**演示/研究性质的开源项目**,目的是证明「极小硬件也能跑像样的语言模型」这件事可行,而不是让你用 8 美元芯片替代手机上的 AI——它的模型很小、能力有限,价值在于「把边界往下压了 100 倍」这个工程突破本身。

⚑ 本文基于开发者 slvDev 的开源项目 esp32-ai 的官方 README(github.com/slvDev/esp32-ai,本站已直接核阅)整理;参数量 28.9M、芯片 ESP32-S3(约 8 美元、512KB SRAM / 8MB PSRAM / 16MB flash)、约 9.5 tok/s、「嵌入表放 flash、每 token 取约 450 字节」、借鉴 Gemma 的 Per-Layer Embeddings、4-bit 下约 14.9MB、以及「此前同类芯片上模型约 26 万参数」等数据均出自该 README。项目为作者个人的演示/研究项目,实际表现与可复现性以其仓库为准。

1

8 美元的单片机,跑起了一个 2890 万参数的语言模型

我们习惯把「跑大模型」和「贵硬件」画等号——至少得有块像样的显卡。但一位开发者(slvDev)做了件相反的事:他把一个 **2890 万参数的语言模型,装进了一块只要约 8 美元的单片机(ESP32-S3)里**,让它**完全在这块芯片上本地运行**、不连任何服务器,一个字一个字地把生成结果打到接在芯片上的小屏幕上,速度大约 **9.5 tokens/秒**。

这件事的分量,要放到对比里才看得清:在这类小芯片上,**此前能跑的语言模型参数量大约只有 26 万**,而这次是 **2890 万**——差不多是过去的 **100 倍**。也就是说,他把「单片机能跑多大的语言模型」这个上限,一口气往上推了两个数量级。

为什么值得看:为什么值得看:这不是又一个「更大更强」的模型,而是一个方向相反的突破——**把 AI 往极小、极便宜的硬件上塞**。它的意义有两层:一是工程上的巧思(怎么在只有 512KB 快内存的芯片上跑百倍大的模型),二是它指向的可能性——如果像样的语言模型能跑在几美元、离线、不联网的芯片上,那 AI 能进入的设备和场景(各种嵌入式、离线小设备)就会大大拓宽。哪怕它现在还只是个演示,这个「下探」的方向本身就值得关注。
项目演示:这个 28.9M 参数模型在 ESP32-S3 上实际生成的文字(一段小故事),端到端约 9.5 tokens/秒;对比字幕点出「此前单片机上的语言模型一直停留在几十万参数」。来源:slvDev/esp32-ai 项目演示动图截帧
2

为什么塞得进去:把大表留在「慢内存」里

一块几美元的单片机,凭什么跑得动百倍大的模型?答案是一个很聪明的「取巧」。

不把模型放进快内存

单片机的痛点是高速内存极小:ESP32-S3 只有 512KB 的 SRAM。按常规做法,整个模型都得能从这块快内存里读到,于是你被死死卡在「只能跑极小模型」——这正是此前同类芯片上模型只有 26 万参数的原因。作者的破局思路是:干脆不把模型主体放进快内存。语言模型的参数,绝大部分其实待在一张巨大的「嵌入表」里——模型是去查表、而不是对它做计算。于是就可以把这张 2500 万行的大表,留在慢速但容量大的 flash 闪存里,每生成一个 token 只从表里取当下用到的那几行、大约 450 字节;而真正参与计算的那一小部分,才放进宝贵的快内存。这样一来,「大模型」几乎不占运行成本,因为你从来不需要把它整个加载进来

28.9M模型参数量(其中 2500 万在 flash 查找表)
~$8ESP32-S3 单片机的价格
~9.5 tok/s端到端生成速度
~100×相比此前同类芯片上模型(约 26 万参数)

这个「大表放 flash、按需取几行」的做法并非凭空发明,而是借鉴了 Google **Gemma** 模型里的 **Per-Layer Embeddings** 思路。最终模型用 4-bit 量化后约 **14.9MB**,正好装进芯片的 16MB flash——一切都卡在这块廉价硬件的物理极限之内。

项目 esp32-ai 在 GitHub 开源(作者 slvDev,星标 900+),包含数据准备、固件、实验等完整目录,主语言为 Python/C/C++。来源:github.com/slvDev/esp32-ai 页面截图
3

它证明了什么,别期待什么

最后把话说清楚,免得两头误解。

是「可行性证明」,不是「实用替代」

它证明的是「可行」:像样规模的语言模型,确实能在几美元、离线、只有巴掌大快内存的芯片上跑起来——这个工程边界被实实在在地往下压了 100 倍。但别把它当「实用替代品」:2890 万参数在语言模型里非常小,它能写点简单的小故事、做些轻量文本生成,能力和你手机、电脑上用的大模型完全不是一个量级,也不该拿来干正经的复杂任务。它的价值不在「好用」,而在「打开了一扇门」——让「把 AI 放进最廉价的嵌入式设备」从空想变成了一个有具体路径的方向。这也是一个个人演示/研究项目,实际效果和可复现性,以作者的开源仓库为准。

一句话:它不会改变你今天怎么用 AI,但它可能预示着 AI 明天能进入的设备,比我们以为的要便宜、要小得多。

来源:slvDev 的开源项目 esp32-ai 官方 README(github.com/slvDev/esp32-ai,本站直接核阅;28.9M 参数、ESP32-S3 约 8 美元及其 512KB SRAM/8MB PSRAM/16MB flash、约 9.5 tok/s、嵌入表 2500 万行留 flash 每 token 取约 450 字节、借鉴 Gemma 的 Per-Layer Embeddings、4-bit 下约 14.9MB、此前同类芯片模型约 26 万参数等均出自此文)。该项目为作者个人的演示/研究项目,实际表现以其仓库为准。配图为项目演示动图截帧与 GitHub 页面截图。

8 美元的单片机跑起了 2890 万参数的语言模型,靠的是「把大模型留在慢内存、每个字只取 450 字节」——它不实用,却把「AI 能塞进多便宜的硬件」这条线往下压了 100 倍。

相关推荐

继续阅读同类文章

优先推荐同分类文章,方便顺着当前主题继续深入。

AI 入门

Ruff 把默认检查规则从 59 条加到 413 条:升级后代码「突然报一堆错」怎么办

极快的 Python 检查器/格式化工具 Ruff(Astral 出品、Rust 编写、MIT、近 4.9 万星)2026-07-23 发布 v0.16.0,最大变化是默认启用规则从 59 猛增到 413。官方理由:这些新默认规则很多能抓语法错误、崩溃类运行时错误,此前却默认关闭、需手动开。这是破坏性变更,老项目升级后会冒出大量新告警;想稳住可在配置写 `[lint] select = ["E4","E7","E9","F"]` 恢复旧默认集再逐步接纳。此外还支持格式化 Markdown 里的 Python 代码块、更灵活的 ruff: ignore 抑制注释、输出直接显示修复 diff。

阅读全文
AI 入门

模型越强,喂它的「规矩」反而越少:Anthropic 的上下文工程新指南,把 Claude Code 系统提示删掉八成

随 Claude Opus 5 发布,Anthropic 出了一篇上下文工程指南(作者 Thariq Shihipar),反直觉的核心是:模型越强,越该少写死规则。证据是他们给高级模型删掉了 Claude Code 80% 以上的系统提示,性能却没降。上下文工程比提示词工程范围更大——指你长期喂给模型的整套背景(系统提示/Skills/CLAUDE.md/记忆)。指南给了 6 条转变:规则→判断、例子→接口设计、一次全给→按需加载、去重复、手动记忆→自动记忆、简化文档→丰富材料。冷静提醒:面向开发者,且社区反馈「自动记忆」会乱联想、推理不透明,宜在可观察可回退的前提下逐步放开。

阅读全文
AI 入门

Anthropic 发布 Claude Opus 5:用一半的价格逼近最强 Fable 5,但它并没有比上一代便宜

Anthropic 于 2026-07-24 发布旗舰 Claude Opus 5,官方定位「以一半价格逼近 Fable 5 的前沿智能」。关键澄清:这里的「半价」是相对最强的 Fable 5,Opus 5 自身定价与上一代 Opus 4.8 相同(每百万输入 5 美元/输出 25 美元)。硬对比:CursorBench 3.2 上与 Fable 5 分差 0.5% 以内、成本仅一半,且全面超过 Opus 4.8。主打「主动」——曾在不给看图时自写视觉流程从像素重建机器零件。安全上擅长找漏洞但刻意不训练武器化、比 Fable 5 少触发约 85% 拦截,并自评为「最难被提示注入」的模型。

阅读全文

版权声明

本文由知享整理发布,主要用于信息整理、技术研究、工具体验与经验分享。

文中提到的工具、项目、软件、网站或服务,版权、商标及相关权益均归原作者、开发者或所属公司所有。本站不提供破解、盗版、绕过付费、未授权下载或侵权资源,相关功能、价格、授权方式、服务条款及隐私政策请以官方网站说明为准。

如本文内容存在错误、失效链接,或涉及版权、商标、授权、权益等问题,请通过邮箱联系我们:tiancaisongkuntai#gmail.com。发送邮件时请将 # 替换为 @,并提供相关证明材料,我们会在核实后及时处理。

转载或引用本站内容,请保留原文链接并注明来源。