一分钟速览
- Cursor 公布了一套新的「智能体集群」(agent swarm)系统:峰值约每秒 1000 次代码提交,而它今年早些时候的旧系统峰值只有每小时 1000 次——快了三千多倍。
- 他们拿它做了个硬核实验:只给一份 835 页的 SQLite 手册,让一群 AI 智能体用 Rust 从零重写 SQLite,限时 4 小时,用数百万条查询测试通过率。
- 多个模型组合都在 4 小时内跑到了 100% 通过:GPT-5.5、Opus 4.8+Composer 混合、Fable 5+Composer 混合。
- 但最有意思的不是速度,是账本:同样干到 100%,「强模型规划 + 便宜模型干活」的混合方案约 1339 美元,全程用 GPT-5.5 要 10565 美元——差了约 8 倍。
- 冷静一句:这是 Cursor 自家做的演示实验,而且 SQLite 的源码很可能在模型训练数据里,「从零重写」到底测出了多少真本事,社区有争议。
⚑ 本文数据全部来自 Cursor 官方博客(2026 年 7 月 20 日,作者 Wilson Lin),图表为官方发布;这是 Cursor 自行设计、自行运行的实验,属厂商自评口径;文中提到的社区质疑来自 Hacker News 公开讨论,属网友观点、未经本站独立复现。
一秒 1000 次提交,4 小时重写一个 SQLite
Cursor(那款 AI 编程工具)公布了他们新一代「智能体集群」系统的实验结果,核心指标很唬人:让一大群 AI 智能体并行写代码时,峰值能达到**每秒约 1000 次代码提交**。作为对比,他们今年早些时候基于浏览器的旧集群,峰值是每小时约 1000 次——新系统在吞吐量上快了三千多倍。
为了证明这套系统真能干活,他们设计了一个很极端的任务:只给智能体一份 835 页的 SQLite 官方手册,让它们用 Rust 语言从零重写出一个 SQLite 数据库引擎,限时 4 小时,最后用 sqllogictest(数百万条 SQL 查询)来打分。结果是:GPT-5.5、Opus 4.8 配 Composer、Fable 5 配 Composer 这几种模型组合,都在 4 小时内把通过率跑到了 100%。
关键不是更快,是「拆得更碎」
一群 AI 一起写代码,最大的麻烦不是不够快,而是互相打架——同时改一个文件、合并时冲突成灾。Cursor 这套系统的核心,是把任务像一棵树一样层层拆开,让每个智能体只盯着自己那一小块,从而把每个智能体需要「记住」的上下文压到最小。

系统把智能体分成两种角色:规划者(Planner) 用能力强、但更贵的模型,负责把大任务拆解、分派;干活者(Worker) 用便宜、快的模型,负责闷头写具体代码。这个分工是后面「省钱」的关键——真正烧钱的是海量的干活者,所以让贵模型只做少量规划、便宜模型做大量执行,账立刻就不一样了。
支撑每秒 1000 次提交的,还有一套 Cursor 自研的版本控制系统(VCS)。普通的 Git 扛不住这个并发量,这套自研 VCS 不仅能接住高频提交,还把「怎么解决冲突」的协调逻辑直接做进了版本控制层——包括自动发现某个文件被改成了「巨无霸」、然后触发重构。
最有意思的是这张成本表
如果只记住这篇文章的一件事,那应该是这张图:干成同一件事(100% 重写 SQLite),用不同的模型组合,花的钱差了一个数量级。

按官方成本图:Opus 4.8 规划 + Composer 执行的混合方案约 1339 美元,Grok 4.5 约 1928 美元,Fable 5 + Composer 混合约 2234 美元;而全程用单一强模型的话,GPT-5.5 要 10565 美元、Fable 5 更是要两万美元级(后两者官方标注为「成本校准用的非正式跑」,不在受控对比里)。同样都干到 100%,混合方案比全用 GPT-5.5 便宜约 8 倍。这说明:在多智能体场景下,「用什么模型干什么活」比「用最强的模型」更决定成本。
这个实验证明了什么,没证明什么
数字很漂亮,但得摆清楚它的边界,别过度解读。
第一,这是 Cursor 自家设计、自家运行的实验,任务、评分、对比方式都由他们定,属于厂商自评口径的能力演示,不是第三方独立评测。第二,也是社区(Hacker News 讨论)质疑最多的一点:SQLite 是世界上最知名的开源数据库之一,它的源码几乎肯定在这些模型的训练数据里。所以「只给文档、从零重写」听起来很硬核,但模型很可能是在「回忆」而不是「从零推理」——这个任务能证明「一群智能体能协同产出可用的复杂代码」,但能不能推广到训练数据里没有的全新问题,这个实验回答不了。
对普通读者,务实的看法是:AI 智能体集群这个方向确实在快速进步,「规划+执行分工」和「压成本」的思路值得关注;但一秒 1000 次提交、4 小时重写 SQLite 这种数字,是精心设计的演示上限,不是你明天就能复现的日常。
来源:Cursor 官方博客《Agent swarm model economics》(2026 年 7 月 20 日,作者 Wilson Lin,能力数据与图表均为官方发布,属厂商自评口径);社区质疑来自 Hacker News 公开讨论(网友观点,未经本站独立复现)。本实验为 Cursor 自行设计运行,非第三方评测;SQLite 是否在训练数据内的争议见正文。
一秒 1000 次提交很唬人,但真正的信号是那张成本表:省钱靠分工,不靠堆最强的模型。


