一分钟速览
- 非营利评测机构 **METR** 于 **2026 年 7 月 21 日**发布新指标 **「支出视野」(Expenditure Horizon)**:在同一个优化问题上分别画出「花多少钱 → 拿到多少提升」的人类曲线和智能体曲线,**两条曲线相交的那个预算,就是智能体的支出视野**。低于这个数,花钱雇 AI 更划算;高于它,雇人更划算。
- 实验场是 **NanoGPT 竞速**——把 GPT 训练到固定损失所需的时间压到最短。METR 通过访谈两位高产贡献者并用 LLM 评判所有 PR,估出人类成本约为**每提升 1% 需要 16 小时、约 2500 美元**(按 150 美元/小时折算)。
- 六个模型的实测结果差距极大:**GPT 5 = 0 美元、Opus 4.1 = 0 美元、Opus 4.5 = 613 美元、GPT 5.2 = 840 美元、GPT 5.5 = 2347 美元、Opus 4.8 = 3333 美元**。前两个的原始曲线看着有进步,**重新验证后相对基线没有任何提升——它们只是在追随噪声**。
- METR 自己给出的结论是保守的:即便最好的模型有几千美元的支出视野,**相对于人类在这个问题上累计投入的总量仍然很小**,因此现有证据表明**自主优化并未显著加速 NanoGPT 上的 AI 研发**。
- ⚑ **一处更正**:有二手摘要把这项研究概括为「AI 只在约 100 美元以下的任务上胜过人类」。**METR 原文中没有 100 美元这个数字**,报告给出的区间是 **0–3000 美元**,且实验是在**单次投入超过 1 万美元**的运行中测出来的。
⚑ 本文事实**全部来自 METR 官方研究简报原文**:《Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT》,作者 Tom Cunningham、Manish Shetty、Vincent Cheng、Nate Rush,发布日期 2026 年 7 月 21 日,本站已直接核阅全文(含方法学章节与附录说明)。文中两张图表取自该简报,**原图页脚标注 CC-BY 授权**,本站按署名要求注明出处。本文**未采用任何二手转述**;文中标记的「更正」是本站将二手摘要与原文逐项比对后的结果,比对依据即上述原文。需要说明的是:METR 是**评测方而非中立第三方复核机构**,其成本估算方法(尤其是人类工时的折算)由 METR 自行设定,报告中也多处自陈不确定性,本站在文中逐处保留了这些自陈。
「AI 比人便宜」这句话,缺一个前提
「用 AI 比雇人便宜」是过去两年被说得最多的一句话,但它通常省略了一个关键前提:**便宜到多少钱为止。**
METR 在 2026 年 7 月 21 日提出的 **「支出视野」** 就是来补这个前提的。做法不复杂:在同一个可量化的优化问题上,分别画出两条「投入 → 产出」曲线——一条是人类的,一条是 AI 智能体的——然后看它们在哪里相交。
**交点对应的那个金额,就是这个智能体的支出视野。** 在交点左边(预算更小),同样的钱花在智能体身上能换来更多提升;在交点右边(预算更大),同样的钱花在人身上更划算。
这个形状背后有个直觉:智能体擅长快速摘到「低垂的果子」,起步很陡;但它能找到的优化类型有限,很快就进入平台期。人类起步慢,却能持续往上爬。METR 把它称作「摘苹果模型」。

实验场是 NanoGPT 竞速,人类成本按每 1% 约 2500 美元计
要画出这两条曲线,得先有一个「人类投入多少、拿到多少」的可靠底数。METR 选的问题是 **NanoGPT 竞速**。
这是一个自 2024 年 5 月起的公开协作项目:硬件固定为 **8 张 NVIDIA H100**,目标固定为在 FineWeb 数据上把交叉熵损失训到 **3.28**,其余的训练配方(架构、优化器、超参、系统级优化)全部开放。参赛者比的就是**墙上时钟训练时间谁更短**。从启动到 2026 年 4 月,这个榜单把训练时间从约 **45 分钟压到了 2 分钟以内**,共 82 条记录、38 位贡献者——其中**前 10 位贡献了 90% 的总加速**。
METR 用了两条互相印证的路径。其一是访谈:找了两位高产贡献者(两人合计贡献 25 条记录,占 PR 总数的 30%、累计加速的 12%),就其中 6 条记录追问耗时——平均每条约 24 小时,这 6 条合计带来 9.8% 的提升,折算下来约 14 小时 / 1%。其二是 LLM 评判:让模型逐一评估所有 PR 的人力投入,得出平均每条 PR 约 13 小时、约 10 小时 / 1%。两条路径接近,METR 取 16 小时 / 1%,按 150 美元/小时折算为整数 2500 美元 / 1% 作为基线。报告对这个数字非常克制,明确写了它「存在很大不确定性」,并且很可能低估——因为无法计入上游研究文献带来的启发,也无法计入与其他贡献者讨论、构思这类摊薄成本。⚑ 以上均为 METR 自陈。
访谈里还有一个有意思的发现:**大部分时间花在了失败的想法上**。一位受访者估计,为了找到某一条记录的信号,先花了约 20 小时试错;而一旦思路对了,**执行可能只要 10 分钟**。两人都不觉得随着经验积累找优化会变快——个人工具和直觉在变好,但**剩下的好想法也在变少**。
六个模型:两个为 0,最高 3333 美元
METR 从竞速榜第 **#78** 号记录(2026 年 3 月,训练时间 **85.56 秒**)出发,跑了六次高投入的自主优化。
结果按模型排开:GPT 5 = 0 美元;Opus 4.1 = 0 美元;Opus 4.5 = 613 美元;GPT 5.2 = 840 美元;GPT 5.5 = 2347 美元;Opus 4.8 = 3333 美元。 前两个为零的含义需要说清楚:它们的原始曲线是有进步的,看上去一路在刷新最好成绩,但 METR 对最终算法重新做了验证,结果相对基线没有任何提升——报告的原话是这两个模型「只是在追随噪声」。这正是这项研究最有价值的地方:竞速榜记录的是「累计最好成绩」,而在一个本身带随机波动的指标上,只要试的次数够多,累计最好成绩必然会往下走,哪怕什么真实改进都没有发生。 至于表现确实变好的 GPT 5.5 和 Opus 4.8,METR 还请竞速项目的维护者判断了可合并性,估计只有约 70% 的贡献是真正可以合入的。

报告自己点出的几处水分
一份研究值不值得信,很大程度上看它有没有主动说出自己的短板。METR 这份简报在这一点上相当坦白。
第一,实验环境可能不够经济。 智能体被给予了 4 个 H100 节点的持续访问权来验证优化,结果它们跑了大量实验,实验成本占到多数轨迹总成本的 70%–90%;METR 认为更优化的执行框架能显著降本,但也判断这只会让曲线水平平移,不会大幅改变支出视野,也不太可能提高能达到的最大加速。第二,原始轨迹会高估进展,原因就是上面说的统计噪声。第三,训练数据污染无法排除——报告直言 OpenAI 与 Anthropic 均未公开披露是否用 NanoGPT 训练过模型,因此无法确定成绩里有多少来自「见过这道题」。第四,人类成本的折算高度依赖假设,报告另外给出了按每 1% 分别为 1000 / 2500 / 10000 美元三种假设下的敏感性分析。这些都是 METR 自己写在正文里的,不是外部批评。
还有一个方法论上的边界值得记住:**支出视野只适用于「有明确单一量化指标的优化问题」**。METR 明确写道,AI 研发中有很多部分**无法被解释成对某个既有指标的最大化**,那些部分这个指标测不了。
数字要读对:不是 100 美元,是 0 到 3000 美元
这项研究在中文与英文的二手摘要里出现了一个具体的偏差:有摘要把它概括为「AI 智能体只在约 100 美元以下的任务上胜过人类,超过就是人类主导」。回到 METR 原文,100 美元这个数字并不存在。 报告摘要里的原始表述是:在投入超过 1 万美元之后,估算出的支出视野区间为 0 至 3000 美元;图表上标注的最高值是 Opus 4.8 的 3333 美元。两者相差一个数量级以上,而且「100 美元以下的任务」这种说法还把「优化问题上的边际预算」误读成了「任务的规模」——支出视野衡量的从来不是任务大小,而是在同一个问题上继续追加投入时,钱花在谁身上更值。⚑ 本站的更正依据是 METR 原文,读者可自行核对该简报摘要段与结果图。
那么这个结果到底说明了什么?METR 给出的判断相当克制:**即便是表现最好的模型,几千美元的支出视野相对于人类在 NanoGPT 上累计投入的总量仍然很小**,所以现有证据表明**自主优化并没有对这个问题上的 AI 研发进度产生显著加速**。
但报告同时留了一道门:这测的是**「纯人类 vs 纯智能体」**,而现实里更常见的是**人机混合**。METR 画了混合曲线的示意图,并指出如果人类在使用 LLM 时做出高效的选择,混合曲线**应当同时优于两条单独曲线**;不过它也引用了相反的证据——**混合的表现有可能反而比纯人类更差**。理想的做法是直接做对照实验,但报告承认这在实践中很难组织。
来源:METR 研究简报《Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT》,作者 Tom Cunningham、Manish Shetty、Vincent Cheng、Nate Rush,2026 年 7 月 21 日(本站直接核阅原文全文;支出视野的定义与「摘苹果模型」、NanoGPT 竞速的固定配置 8×H100 / FineWeb / 损失 3.28、2024 年 5 月启动至 2026 年 4 月共 82 条记录 38 位贡献者、前 10 位占 90% 加速、45 分钟压至 2 分钟以内、两位受访者 25 条记录占 PR 总数 30% 与累计加速 12%、6 条记录平均 24 小时合计 9.8% 提升、LLM 评判平均 13 小时/PR 与 10 小时/1%、基线取 16 小时/1% 与 150 美元/小时折算得 2500 美元/1%、起点为第 #78 号记录 85.56 秒、六个模型的支出视野数值、GPT 5 与 Opus 4.1「只是在追随噪声」、约 70% 可合并、实验成本占 70%–90%、训练数据污染未获披露、1000/2500/10000 美元三档敏感性分析、方法仅适用于有明确单一量化指标的优化问题、混合优化的示意与相反证据、以及「自主优化未显著加速 NanoGPT 上的 AI 研发」的结论,均出自该简报)。两张配图取自该简报,**原图页脚标注 CC-BY 授权**,已按署名要求注明来源。⚑ 文中「更正」一节的依据为本站将流传的二手摘要与上述原文逐项比对的结果;**本站未采用任何二手转述作为事实来源**。另需提示:METR 为评测方,成本折算口径由其自行设定,报告中多处自陈不确定性,本站已逐处保留。
「AI 比人便宜」不是一个是非题,而是一条曲线。METR 把交点标了出来:在 NanoGPT 这个问题上,最好的模型是 3333 美元,最差的两个是 0——而且那两个的「进步」重新验证之后原地不动。比数字更值得记住的是那个方法:**看到一条不断刷新的最好成绩曲线时,先问一句它有没有被重新验证过。**


