返回文章列表
文章详情AI 入门

Anthropic 自曝:Claude Code 团队 65% 的代码由 AI 提交,系统提示词砍了 80%

Anthropic 的 Claude Code 团队在公开访谈里摊开内部数字:自己团队 65% 的工程 PR 已由 AI 完成,系统提示词为适配新模型砍掉 80%。更实用的是他们写提示词的最新经验——新模型上别堆示例、别列一堆禁令、别下绝对命令。数字是团队自述口径,但那几条提示词经验谁都能今天就用。

更新于 2026-07-215 分钟4

一分钟速览

  • Anthropic 的 Claude Code 团队在一次公开访谈里透露:他们自己团队 65% 的产品工程代码提交(PR),如今是由 AI(Claude Tag)完成的。
  • 更实用的一条:他们给 Claude Code 写的系统提示词,为了适配 Fable 5、Opus 4.8 这些新模型,直接砍掉了 80%——而且不同模型用不同的提示词。
  • 砍掉的主要是两类东西:给模型看的「示例」,和一长串「不要做 X」的禁令——团队发现新模型有了这些反而更差。
  • 他们的内部流程也摊开了:新功能先只给自己员工用,只有证明用户留得住才对外发布;关键改动仍人工审核,外围改动已交给 AI 全自动审。
  • 这些是 Anthropic 团队的自述数字(仅代表他们自己团队),不是第三方审计;但里面几条写提示词的经验,对任何在用 AI 的人都有参考价值。

⚑ 本文事实来自 Anthropic Claude Code 团队成员 Cat Wu 与 Thariq Shihipar 的公开访谈,经开发者 Simon Willison 整理记录;文中数据为该团队内部自述口径(仅代表其自身团队,非第三方独立核验),安全性表述为 Anthropic 官方说法。

1

造工具的团队,自己用得有多狠

Anthropic(Claude 的公司)的 Claude Code 团队最近在一场炉边访谈里,罕见地摊开了一组内部数字,最扎眼的一条是:他们自己这个产品工程团队,**如今 65% 的代码提交是由 AI 完成的**(通过 Claude Tag,一个能在 Slack 里协作调用 Claude 的集成)。换句话说,造 AI 编程工具的团队,自己已经把大部分写代码的活儿交给了 AI。

要注意这是「他们团队自己」的数字,不是行业平均,也不是说人类工程师不干活了——关键改动仍然由人把关。但它至少说明,在一个工具打磨得足够顺手、且团队完全信任的前提下,AI 承担日常代码工作的比例可以到相当高。

为什么值得看:为什么值得看:市面上关于「AI 写代码」的说法要么是厂商广告、要么是网友吐槽,很少有「造这个工具的团队自己怎么用、用到什么程度」的一手数据。这场访谈给的正是这种内部视角——而且里面几条关于「怎么给 AI 写指令」的经验,不是只有程序员用得上,任何在认真用 AI 的人都能借鉴。
65%该团队目前由 AI 完成的产品工程 PR 比例(团队自述)
80%Claude Code 系统提示词为适配新模型削减的比例
数千次Auto Mode 上线前做的评测(eval)次数
2 月Claude Code 首次上线的月份(距访谈不到一年半)
Claude Code 官方产品页:可在终端、IDE、Slack、网页等多处调用。本文讨论的正是打造这款工具的团队自己的内部用法。来源:Claude 官方站点截图
2

最值得抄的一段:怎么给新模型写指令

这场访谈里最有普适价值的,是团队关于「系统提示词」的经验。他们为了适配 Fable 5、Opus 4.8 这些新模型,把 Claude Code 的系统提示词砍掉了整整 80%,而且不同模型现在用不同的提示词。砍掉的主要是这几类,每一条都值得普通用户记下来。

别再堆示例了

团队原话:「移除示例极其有帮助」。早期的模型需要你在提示词里给几个例子照着学,但新模型不一样——喂示例反而会限制它,让它没那么有创意。也就是说,你如果还在用「给 AI 看几个范例再让它照做」的老习惯,在新模型上可能是帮倒忙。

少写「不要做 X」

团队还刻意减少了那种一长串「不要这样、禁止那样」的禁令式指令。原因是:这些限制性指令容易和用户的真实需求打架,把模型搞糊涂,反而降低输出质量。与其列一堆禁令,不如把你真正想要的正面说清楚。

还有一条更微妙的:团队发现有些指令「90% 情况下是对的,但有实打实的 10% 场景并不成立」,对这种话他们会特意把措辞软化,而不是写成绝对命令。放到日常用 AI 上就是——少用「必须永远这样」的绝对指令,给模型留一点判断余地,往往结果更好。

3

先自己吃狗粮,再逐步放手给 AI 审

除了写提示词,团队的内部流程也值得一看。新功能不是做完就发:他们先只推给 Anthropic 员工内部用(内部叫 dogfooding),**只有当一个功能证明「用户会留下来继续用」,才会对外发布**——留存说话,不靠拍脑袋。

代码审核则是分层放手的。像系统提示词这种关键改动,仍然要求代码所有者人工审核;但外围的改动,已经转为**由 Claude 全自动审核**——而且这个「敢把审核交给 AI」的信任,是经过了六个多月的过程才逐步建立的,不是一上来就全托付。他们的 Auto Mode(自动模式)从 1 月起内部使用,上线前做了数千次评测和多轮红队测试,官方称其在提示注入、数据泄露方面「风险远低于普通人类审核者」——这是 Anthropic 自己的安全说法,你可以参考,但值得留个心眼。

4

这些数字该怎么看

这场访谈信息量很大,但用之前得摆清楚边界。

三个限定

第一,65%、80% 这些都是Anthropic 团队自己团队的内部数字,是自述口径,没有第三方审计,也不代表你的团队照做就能到这个比例。第二,「造工具的人自己用得顺」和「工具对所有人都好用」之间有距离——他们对自家工具的熟悉度、代码库的规范度,都不是普通用户的默认起点。第三,「AI 审核风险低于人类」是 Anthropic 的安全主张,方向可信,但涉及安全的结论,最好等更多独立验证。

真正能直接拿走的,是那几条提示词经验:新模型上少堆示例、少写禁令清单、少下绝对命令——这些不需要你是 Anthropic 员工也能今天就试。

来源:Anthropic Claude Code 团队成员 Cat Wu、Thariq Shihipar 公开访谈,由 Simon Willison 整理记录(2026 年 7 月);文中比例、次数等为该团队内部自述口径,非第三方核验;Auto Mode 的安全性表述为 Anthropic 官方说法。配图为 Claude 官方产品页截图。

最值钱的不是「65% 代码靠 AI」,是那三条谁都能抄的写指令经验:别堆示例、别列禁令、别下死命令。

相关推荐

继续阅读同类文章

优先推荐同分类文章,方便顺着当前主题继续深入。

AI 入门

Google 一次发三个 Gemini:3.6 Flash 更强、Flash-Lite 更便宜、Flash Cyber 你用不了

Google 同时发布 Gemini 3.6 Flash(主力、更聪明、$1.5/$7.5)、3.5 Flash-Lite(便宜快跑、$0.3/$2.5、350 token/秒)和 3.5 Flash Cyber(安全特化,但仅限政府与可信合作伙伴)。官方跑分显示 3.6 Flash 全面超上代。附冷静提醒:跑分是自评口径、命名混乱、社区吐槽涨价与老模型弃用。

阅读全文
AI 入门

Cursor 智能体集群:一秒 1000 次提交,4 小时用 Rust 重写了个 SQLite

Cursor 公布新一代 AI 智能体集群:峰值每秒约 1000 次提交(旧系统每小时 1000 次),并让一群 AI 只靠 835 页手册、4 小时从零用 Rust 重写 SQLite,多个模型组合跑到 100%。但最有价值的是成本账——「强模型规划+便宜模型干活」比全用 GPT-5.5 便宜约 8 倍。附冷静提醒:这是官方自演示,且 SQLite 很可能在训练数据里。

阅读全文
AI 入门

阿里 Qwen-Image-3.0:主打复杂文字排版,但演示图好看不等于你能用出来

阿里发布第三代图像生成模型 Qwen-Image-3.0,官方主打「实」——一次生成报纸/试卷/九宫格信息图、10px 小字、12 国语言渲染。官方精选示例确实亮眼,但没公开提示词和种子、没有跑分、权重未开放、社区实测褒贬不一。本文分清「官方自评」与「待验证」,冷静看这次图像模型发布。

阅读全文

版权声明

本文由知享整理发布,主要用于信息整理、技术研究、工具体验与经验分享。

文中提到的工具、项目、软件、网站或服务,版权、商标及相关权益均归原作者、开发者或所属公司所有。本站不提供破解、盗版、绕过付费、未授权下载或侵权资源,相关功能、价格、授权方式、服务条款及隐私政策请以官方网站说明为准。

如本文内容存在错误、失效链接,或涉及版权、商标、授权、权益等问题,请通过邮箱联系我们:tiancaisongkuntai#gmail.com。发送邮件时请将 # 替换为 @,并提供相关证明材料,我们会在核实后及时处理。

转载或引用本站内容,请保留原文链接并注明来源。