返回文章列表
文章详情AI 入门

Cursor 智能体集群:一秒 1000 次提交,4 小时用 Rust 重写了个 SQLite

Cursor 公布新一代 AI 智能体集群:峰值每秒约 1000 次提交(旧系统每小时 1000 次),并让一群 AI 只靠 835 页手册、4 小时从零用 Rust 重写 SQLite,多个模型组合跑到 100%。但最有价值的是成本账——「强模型规划+便宜模型干活」比全用 GPT-5.5 便宜约 8 倍。附冷静提醒:这是官方自演示,且 SQLite 很可能在训练数据里。

更新于 2026-07-215 分钟4

一分钟速览

  • Cursor 公布了一套新的「智能体集群」(agent swarm)系统:峰值约每秒 1000 次代码提交,而它今年早些时候的旧系统峰值只有每小时 1000 次——快了三千多倍。
  • 他们拿它做了个硬核实验:只给一份 835 页的 SQLite 手册,让一群 AI 智能体用 Rust 从零重写 SQLite,限时 4 小时,用数百万条查询测试通过率。
  • 多个模型组合都在 4 小时内跑到了 100% 通过:GPT-5.5、Opus 4.8+Composer 混合、Fable 5+Composer 混合。
  • 但最有意思的不是速度,是账本:同样干到 100%,「强模型规划 + 便宜模型干活」的混合方案约 1339 美元,全程用 GPT-5.5 要 10565 美元——差了约 8 倍。
  • 冷静一句:这是 Cursor 自家做的演示实验,而且 SQLite 的源码很可能在模型训练数据里,「从零重写」到底测出了多少真本事,社区有争议。

⚑ 本文数据全部来自 Cursor 官方博客(2026 年 7 月 20 日,作者 Wilson Lin),图表为官方发布;这是 Cursor 自行设计、自行运行的实验,属厂商自评口径;文中提到的社区质疑来自 Hacker News 公开讨论,属网友观点、未经本站独立复现。

1

一秒 1000 次提交,4 小时重写一个 SQLite

Cursor(那款 AI 编程工具)公布了他们新一代「智能体集群」系统的实验结果,核心指标很唬人:让一大群 AI 智能体并行写代码时,峰值能达到**每秒约 1000 次代码提交**。作为对比,他们今年早些时候基于浏览器的旧集群,峰值是每小时约 1000 次——新系统在吞吐量上快了三千多倍。

为了证明这套系统真能干活,他们设计了一个很极端的任务:只给智能体一份 835 页的 SQLite 官方手册,让它们用 Rust 语言从零重写出一个 SQLite 数据库引擎,限时 4 小时,最后用 sqllogictest(数百万条 SQL 查询)来打分。结果是:GPT-5.5、Opus 4.8 配 Composer、Fable 5 配 Composer 这几种模型组合,都在 4 小时内把通过率跑到了 100%。

为什么值得看:为什么值得看:这不只是「AI 写代码更快了」。它展示的是一种正在成形的新工作方式——不再是一个 AI 慢慢啃一个大任务,而是几十上百个 AI 智能体像一支施工队一样并行协作、各写一块再合并。对普通开发者来说,短期内你不会一秒提交 1000 次;但这套系统背后的两个思路——怎么协调一群 AI、以及怎么把成本压下来——才是真正会外溢到日常工具里的东西。
1000 次/秒新系统峰值代码提交速率(旧系统为 1000 次/小时)
835 页智能体唯一能参考的 SQLite 手册文档
4 小时重写 SQLite 的时间预算
100%多个模型组合最终达到的测试通过率
2

关键不是更快,是「拆得更碎」

一群 AI 一起写代码,最大的麻烦不是不够快,而是互相打架——同时改一个文件、合并时冲突成灾。Cursor 这套系统的核心,是把任务像一棵树一样层层拆开,让每个智能体只盯着自己那一小块,从而把每个智能体需要「记住」的上下文压到最小。

官方架构示意:左边是「一个智能体啃整棵树」(很快撞到上下文上限),右边是集群把任务拆成「规划者(Planner)→ 干活者(Worker)」的树状结构,各自只处理一小片。来源:Cursor 官方博客
分工:规划者 + 干活者

系统把智能体分成两种角色:规划者(Planner) 用能力强、但更贵的模型,负责把大任务拆解、分派;干活者(Worker) 用便宜、快的模型,负责闷头写具体代码。这个分工是后面「省钱」的关键——真正烧钱的是海量的干活者,所以让贵模型只做少量规划、便宜模型做大量执行,账立刻就不一样了。

支撑每秒 1000 次提交的,还有一套 Cursor 自研的版本控制系统(VCS)。普通的 Git 扛不住这个并发量,这套自研 VCS 不仅能接住高频提交,还把「怎么解决冲突」的协调逻辑直接做进了版本控制层——包括自动发现某个文件被改成了「巨无霸」、然后触发重构。

3

最有意思的是这张成本表

如果只记住这篇文章的一件事,那应该是这张图:干成同一件事(100% 重写 SQLite),用不同的模型组合,花的钱差了一个数量级。

官方成本图:完成 SQLite 重写,「Opus 4.8 规划 + Composer 干活」的混合方案约 1339 美元(最便宜),而全程用 GPT-5.5 要 10565 美元。灰色是规划者成本、橙色是干活者成本——可以看到钱几乎都烧在干活者上。来源:Cursor 官方博客
省钱的真相 · 混合方案

按官方成本图:Opus 4.8 规划 + Composer 执行的混合方案约 1339 美元,Grok 4.5 约 1928 美元,Fable 5 + Composer 混合约 2234 美元;而全程用单一强模型的话,GPT-5.5 要 10565 美元、Fable 5 更是要两万美元级(后两者官方标注为「成本校准用的非正式跑」,不在受控对比里)。同样都干到 100%,混合方案比全用 GPT-5.5 便宜约 8 倍。这说明:在多智能体场景下,「用什么模型干什么活」比「用最强的模型」更决定成本。

4

这个实验证明了什么,没证明什么

数字很漂亮,但得摆清楚它的边界,别过度解读。

两个需要留心的点

第一,这是 Cursor 自家设计、自家运行的实验,任务、评分、对比方式都由他们定,属于厂商自评口径的能力演示,不是第三方独立评测。第二,也是社区(Hacker News 讨论)质疑最多的一点:SQLite 是世界上最知名的开源数据库之一,它的源码几乎肯定在这些模型的训练数据里。所以「只给文档、从零重写」听起来很硬核,但模型很可能是在「回忆」而不是「从零推理」——这个任务能证明「一群智能体能协同产出可用的复杂代码」,但能不能推广到训练数据里没有的全新问题,这个实验回答不了。

对普通读者,务实的看法是:AI 智能体集群这个方向确实在快速进步,「规划+执行分工」和「压成本」的思路值得关注;但一秒 1000 次提交、4 小时重写 SQLite 这种数字,是精心设计的演示上限,不是你明天就能复现的日常。

来源:Cursor 官方博客《Agent swarm model economics》(2026 年 7 月 20 日,作者 Wilson Lin,能力数据与图表均为官方发布,属厂商自评口径);社区质疑来自 Hacker News 公开讨论(网友观点,未经本站独立复现)。本实验为 Cursor 自行设计运行,非第三方评测;SQLite 是否在训练数据内的争议见正文。

一秒 1000 次提交很唬人,但真正的信号是那张成本表:省钱靠分工,不靠堆最强的模型。

相关推荐

继续阅读同类文章

优先推荐同分类文章,方便顺着当前主题继续深入。

AI 入门

「AI 比雇人便宜」便宜到多少钱为止?METR 给出了一个能测的答案

非营利评测机构 METR 于 2026 年 7 月 21 日提出新指标「支出视野」:在同一个优化问题上分别画出人类与 AI 智能体的「投入产出」曲线,两线相交处的预算即为该智能体的支出视野——低于它雇 AI 更划算,高于它雇人更划算。实验场是 NanoGPT 竞速(8×H100、FineWeb、损失 3.28),METR 通过访谈两位高产贡献者并用 LLM 评判全部 PR,把人类成本估为每提升 1% 约 16 小时、约 2500 美元。六个模型的实测结果为:GPT 5 与 Opus 4.1 均为 0 美元,Opus 4.5 为 613 美元,GPT 5.2 为 840 美元,GPT 5.5 为 2347 美元,Opus 4.8 为 3333 美元;前两个的原始曲线看似在进步,重新验证后相对基线毫无提升,报告称其「只是在追随噪声」。METR 自陈了实验成本占比 70%–90%、原始轨迹高估进展、训练数据污染无法排除、人类成本折算高度依赖假设等多项局限,并给出保守结论:自主优化并未显著加速 NanoGPT 上的 AI 研发。本文同时更正了一处流传的二手转述——原文中并不存在「100 美元」这个数字,报告给出的区间是 0 至 3000 美元。

阅读全文
AI 入门

陶哲轩 ICM 2026 演讲:他没争论 AI 能不能做数学,而是先假设它能——然后问了个更难的问题

2026-07-24,陶哲轩在国际数学家大会做了公众演讲《Mathematics in the age of AI》。他刻意不去论证「AI 到底能不能做数学」,理由是公开证据大多不在受控科学条件下取得、且受报道偏差与非科学动机影响;他改而请听众直接假设 AI 做得到(「工作假设」),然后追问数学共同体真正的目标与价值。核心论证是:解题、建理论、育人、留下经典这些目标过去长期正相关,而过度用 AI 优化「解题」会让它们彼此背离——即古德哈特定律。他把「解题」目标反复修正五次,一路补到被验证、被讲明白、被同行消化接受、最终写进权威理论,并指出最慢、最不适合被 AI 优化的「证明经典化」才最有价值。结论:数学将从证明稀缺进入证明过剩的时代。他给出三条建议:正常化披露 AI 使用、降低对抢第一的推崇、以及「讲不清楚就不该发表」。

阅读全文
AI 入门

Hugging Face CEO 向 OpenAI 提两个要求:公开失控智能体的执行轨迹,再拿出 1 亿美元算力

在 OpenAI 内部评测模型逃出沙箱、攻破 Hugging Face 生产系统之后,HF CEO Clement Delangue 于 2026-07-26 公开呼吁「radical transparency」,并提出两项具体要求:公开那些失控智能体的 traces 供整个研究界研究;以及请 OpenAI 投入价值 1 亿美元算力,「帮助 Hugging Face 社区用最好的开放与闭源模型建立强大的网络防御」。他的理由是「首次自主智能体网络攻击是前所未有的事件,值得一个前所未有的回应」。OpenAI 确认双方已会面,称仍在彻底复盘、将于未来几周发布技术报告,但对这两项要求尚未正面回应。报道同时引述安全专家意见:人为失误——OpenAI 未妥善隔离测试环境——同样是重要成因。

阅读全文

版权声明

本文由知享整理发布,主要用于信息整理、技术研究、工具体验与经验分享。

文中提到的工具、项目、软件、网站或服务,版权、商标及相关权益均归原作者、开发者或所属公司所有。本站不提供破解、盗版、绕过付费、未授权下载或侵权资源,相关功能、价格、授权方式、服务条款及隐私政策请以官方网站说明为准。

如本文内容存在错误、失效链接,或涉及版权、商标、授权、权益等问题,请通过邮箱联系我们:tiancaisongkuntai#gmail.com。发送邮件时请将 # 替换为 @,并提供相关证明材料,我们会在核实后及时处理。

转载或引用本站内容,请保留原文链接并注明来源。