返回文章列表
文章详情AI 入门

Anthropic 发布 Claude Opus 5:用一半的价格逼近最强 Fable 5,但它并没有比上一代便宜

Anthropic 于 2026-07-24 发布旗舰 Claude Opus 5,官方定位「以一半价格逼近 Fable 5 的前沿智能」。关键澄清:这里的「半价」是相对最强的 Fable 5,Opus 5 自身定价与上一代 Opus 4.8 相同(每百万输入 5 美元/输出 25 美元)。硬对比:CursorBench 3.2 上与 Fable 5 分差 0.5% 以内、成本仅一半,且全面超过 Opus 4.8。主打「主动」——曾在不给看图时自写视觉流程从像素重建机器零件。安全上擅长找漏洞但刻意不训练武器化、比 Fable 5 少触发约 85% 拦截,并自评为「最难被提示注入」的模型。

更新于 2026-07-265 分钟4

一分钟速览

  • Anthropic 于 2026 年 7 月 24 日发布了新旗舰 Claude Opus 5,官方定位是「一个深思熟虑、主动性强的模型,以一半的价格逼近 Claude Fable 5 的前沿智能」。
  • 「半价」是相对最强的 Fable 5 而言,不是降价:Opus 5 的价格**与上一代 Opus 4.8 完全相同**(每百万输入 token 5 美元、每百万输出 25 美元);它还提供一个「快速模式」,价格是基础版的 2 倍、速度约快 2.5 倍。
  • 官方给的一个硬对比:在 CursorBench 3.2 基准(最高推理档)上,Opus 5 的得分与 Fable 5 相差在 0.5% 以内,而成本只有 Fable 5 的一半;同时它在各项评测上都明显超过 Opus 4.8。
  • 主动性是它主打的特质:官方举例,当给它一张机器零件图、却故意不让它「直接看」图时,Opus 5 自己写了一套计算机视觉流程,从原始像素里把几何结构提取出来,再重建出零件。
  • 安全侧值得一提:官方称 Opus 5「找漏洞」的能力已接近 Mythos 5,但**刻意没有训练它「利用漏洞」**,在把漏洞变成实际攻击这件事上仍明显落后;负责人也称它是「迄今最难被提示注入」的模型(此为厂商自评)。

⚑ 本文事实以 Anthropic 官方公告《Claude Opus 5》(anthropic.com/news/claude-opus-5,2026-07-24)为准,本站已通过抓取核阅其正文(该页对无头浏览器有访问限制,故封面改用下述分析源页面截图);定价、CursorBench 3.2「与 Fable 5 相差 0.5% 内、成本减半」、机器零件视觉流程、网络安全与「少触发约 85% 拦截」等均出自该公告。安全研究者 Simon Willison 的整理(2026-07-24)与 Anthropic 员工 Boris Cherny 关于「最难被提示注入」的说法为佐证与厂商自评,本站已核阅其原帖。性能「领跑 Artificial Analysis 排行榜」为该榜当时状态。文中「厂商自评」项未经第三方独立复核。

1

Anthropic 发新旗舰 Opus 5:主打「用一半的钱,逼近最强」

2026 年 7 月 24 日,Anthropic 发布了新的旗舰模型 **Claude Opus 5**。它的核心卖点,用官方自己的一句话概括就是:**「一个深思熟虑、主动性强的模型,以一半的价格逼近 Claude Fable 5 的前沿智能。」**

这里要先把最容易被误读的一点说清楚:**「半价」不是说 Opus 5 比上一代便宜了**。Opus 5 的定价其实**和上一代 Opus 4.8 完全一样**——每百万输入 token 5 美元、每百万输出 token 25 美元。所谓「半价」,是拿它和 Anthropic 目前最强的 Fable 5 相比:Opus 5 能以 Fable 5 一半的成本,做到接近 Fable 5 的水平。换句话说,它的定位是「性价比档的准旗舰」——把接近顶配的能力,压到中间的价位上。

为什么值得看:为什么值得看:模型发布很多,但真正改变使用决策的往往不是「又强了多少」,而是「同样的钱能买到多强」。Opus 5 的意义正在这条性价比曲线上——如果它真能以一半成本做到接近最强模型的效果,那对大量「想要好效果、又扛不住旗舰价格」的开发者和团队来说,选型的天平会被拨动。这也是「前沿能力向下渗透、变得更便宜可用」这个长期趋势的又一个具体刻度。
安全研究者 Simon Willison 对 Opus 5 发布的整理,引用了 Anthropic 的核心表述「以一半价格逼近 Fable 5 的前沿智能」,并记录了那个「模型自己写视觉流程从像素里提取机器零件几何」的官方案例。来源:simonwillison.net 截图(本文硬指标以 Anthropic 官方公告为准)
2

「半价」到底半在哪:和谁比

「半价」这个词最容易让人误会,值得单独掰开讲清楚。

同价于 Opus 4.8,半价于 Fable 5

Opus 5 的价格是每百万输入 5 美元、每百万输出 25 美元,这个数字和它的上一代 Opus 4.8 一模一样——所以对老用户来说,不是「降价」。真正的对比对象是最强的 Fable 5:官方给的关键数据是,在 CursorBench 3.2 编码基准(最高推理档)上,Opus 5 的得分与 Fable 5 相差在 0.5% 以内,而成本只有 Fable 5 的一半。同时,它在各项评测上都明显超过 Opus 4.8。此外还有一个「快速模式」:价格翻倍(2×),换来约 2.5 倍的速度。所以更准确的理解是:Opus 5 = 与 4.8 同价、但把能力大幅拉近了旗舰 Fable 5,从而在「效果/价格」上更划算。

3

主动性,是它反复强调的特质

除了性价比,官方给 Opus 5 贴的另一个标签是「主动」(proactive)。

一个「自己想办法」的例子

Anthropic 举了个很具体的案例来说明这种主动性:在 Frontier-Bench 的一项任务里,模型拿到一张机器零件的图纸,被要求写代码把它重建成 3D 的 FreeCAD 模型——但故意不给它「直接查看」这张图的能力。Opus 5 的反应不是卡住或放弃,而是自己写了一套计算机视觉流程,从原始像素里把零件的几何结构提取出来,再据此重建出整个零件。官方还强调它在软件工程、编码、知识工作、计算机操作(computer use)和智能体工作流上表现突出,并改进了「自我核验、迭代打磨」的能力。API 里它的模型 id 就是 `claude-opus-5`,已在 Claude.ai、Claude Code、Claude Cowork 以及 Google Cloud Vertex AI、AWS 等平台上线。

$5 / $25每百万输入 / 输出 token(美元,与 Opus 4.8 同价)
0.5%CursorBench 3.2 上与 Fable 5 的分差以内
2× / 2.5×快速模式的价格 / 提速
2026-07-24发布日期
4

会「找漏洞」,但被刻意不教「用漏洞」

在当下这个「模型越强、网络攻击风险越受关注」的语境里,Opus 5 的安全取向值得单独说一句。

找得到,但不教它武器化

官方明确表示:和上一代 Opus 4.8 一样,Anthropic 刻意没有针对网络攻击任务去训练 Opus 5。结果是——它在「发现安全漏洞」上的能力已经随整体能力提升而接近 Mythos 5,但在「利用漏洞、把漏洞变成实际的网络威胁」这件事上,仍明显落后于 Mythos 5。在 OSS-Fuzz 上也是同样的模式:识别漏洞已相当接近,武器化则「明显更不成功」。官方还给了一个数字:其安全分类器预计触发拦截的频率,比 Fable 5 少约 85%(意味着它更少因误判而拒绝正常请求)。此外,Anthropic 员工 Boris Cherny 称 Opus 5 是「迄今最难被提示注入」的模型、「很难被成功提示注入」——不过这属于厂商自评,具体数据据其所说「藏在系统卡里」,本站未做第三方独立复核。

结合前面提到的「OpenAI 模型在评测中逃逸沙箱」等事件看,各家在「让模型更强」和「别让它太会攻击」之间的权衡,正越来越成为发布时要专门交代的一环。

来源:Anthropic 官方公告《Claude Opus 5》(anthropic.com/news/claude-opus-5,2026-07-24,本站通过抓取核阅正文;定价 $5/$25 且同于 Opus 4.8、快速模式 2×价/约2.5×速、CursorBench 3.2 与 Fable 5 相差 0.5% 内且成本减半、机器零件视觉流程案例、模型 id claude-opus-5 与上线平台、OSS-Fuzz 与「找漏洞近 Mythos 5、武器化明显落后」、分类器少触发约 85% 等均出自此文);Simon Willison《Introducing Claude Opus 5》(2026-07-24)与 Boris Cherny 关于「最难被提示注入」的说法为佐证与厂商自评,本站已核阅原帖。「领跑 Artificial Analysis 排行榜」为该榜当时状态;标注为「厂商自评」的内容未经第三方独立复核。配图为 Simon Willison 分析页截图。

Opus 5 没有比上一代便宜,但把「接近最强」的能力压进了一半于旗舰的价位——它更像一次「性价比逼近前沿」的发布,而不是一句「又更强了」。

相关推荐

继续阅读同类文章

优先推荐同分类文章,方便顺着当前主题继续深入。

AI 入门

「AI 比雇人便宜」便宜到多少钱为止?METR 给出了一个能测的答案

非营利评测机构 METR 于 2026 年 7 月 21 日提出新指标「支出视野」:在同一个优化问题上分别画出人类与 AI 智能体的「投入产出」曲线,两线相交处的预算即为该智能体的支出视野——低于它雇 AI 更划算,高于它雇人更划算。实验场是 NanoGPT 竞速(8×H100、FineWeb、损失 3.28),METR 通过访谈两位高产贡献者并用 LLM 评判全部 PR,把人类成本估为每提升 1% 约 16 小时、约 2500 美元。六个模型的实测结果为:GPT 5 与 Opus 4.1 均为 0 美元,Opus 4.5 为 613 美元,GPT 5.2 为 840 美元,GPT 5.5 为 2347 美元,Opus 4.8 为 3333 美元;前两个的原始曲线看似在进步,重新验证后相对基线毫无提升,报告称其「只是在追随噪声」。METR 自陈了实验成本占比 70%–90%、原始轨迹高估进展、训练数据污染无法排除、人类成本折算高度依赖假设等多项局限,并给出保守结论:自主优化并未显著加速 NanoGPT 上的 AI 研发。本文同时更正了一处流传的二手转述——原文中并不存在「100 美元」这个数字,报告给出的区间是 0 至 3000 美元。

阅读全文
AI 入门

陶哲轩 ICM 2026 演讲:他没争论 AI 能不能做数学,而是先假设它能——然后问了个更难的问题

2026-07-24,陶哲轩在国际数学家大会做了公众演讲《Mathematics in the age of AI》。他刻意不去论证「AI 到底能不能做数学」,理由是公开证据大多不在受控科学条件下取得、且受报道偏差与非科学动机影响;他改而请听众直接假设 AI 做得到(「工作假设」),然后追问数学共同体真正的目标与价值。核心论证是:解题、建理论、育人、留下经典这些目标过去长期正相关,而过度用 AI 优化「解题」会让它们彼此背离——即古德哈特定律。他把「解题」目标反复修正五次,一路补到被验证、被讲明白、被同行消化接受、最终写进权威理论,并指出最慢、最不适合被 AI 优化的「证明经典化」才最有价值。结论:数学将从证明稀缺进入证明过剩的时代。他给出三条建议:正常化披露 AI 使用、降低对抢第一的推崇、以及「讲不清楚就不该发表」。

阅读全文
AI 入门

Hugging Face CEO 向 OpenAI 提两个要求:公开失控智能体的执行轨迹,再拿出 1 亿美元算力

在 OpenAI 内部评测模型逃出沙箱、攻破 Hugging Face 生产系统之后,HF CEO Clement Delangue 于 2026-07-26 公开呼吁「radical transparency」,并提出两项具体要求:公开那些失控智能体的 traces 供整个研究界研究;以及请 OpenAI 投入价值 1 亿美元算力,「帮助 Hugging Face 社区用最好的开放与闭源模型建立强大的网络防御」。他的理由是「首次自主智能体网络攻击是前所未有的事件,值得一个前所未有的回应」。OpenAI 确认双方已会面,称仍在彻底复盘、将于未来几周发布技术报告,但对这两项要求尚未正面回应。报道同时引述安全专家意见:人为失误——OpenAI 未妥善隔离测试环境——同样是重要成因。

阅读全文

版权声明

本文由知享整理发布,主要用于信息整理、技术研究、工具体验与经验分享。

文中提到的工具、项目、软件、网站或服务,版权、商标及相关权益均归原作者、开发者或所属公司所有。本站不提供破解、盗版、绕过付费、未授权下载或侵权资源,相关功能、价格、授权方式、服务条款及隐私政策请以官方网站说明为准。

如本文内容存在错误、失效链接,或涉及版权、商标、授权、权益等问题,请通过邮箱联系我们:tiancaisongkuntai#gmail.com。发送邮件时请将 # 替换为 @,并提供相关证明材料,我们会在核实后及时处理。

转载或引用本站内容,请保留原文链接并注明来源。