返回文章列表
文章详情AI 入门

Kimi K3 发布:2.8 万亿参数的开源模型,价格追平 Claude Sonnet 5

月之暗面发布全球首个 3 万亿参数级开放模型 Kimi K3:多项长时程 Agent 测试第一、当天全渠道可用、权重 7 月 27 日前公开;独立测试印证实力的同时也测出幻觉率升到 51%,定价则告别了中国开源模型的「白菜价」时代。

更新于 2026-07-175 分钟6

一分钟速览

  • 月之暗面 7 月 17 日发布新旗舰 Kimi K3:2.8 万亿参数、原生看图看视频、一次读 100 万 token,是全球第一个开放权重做到 3 万亿参数级的模型。
  • 网页、App、Kimi Work、Kimi Code 和 API 当天全量可用;全部模型权重承诺 7 月 27 日前公开,技术报告随权重发布。
  • 官方自评里它在「长时间连续干活」类测试(超长跑软件工程、网页检索、自动化)多项领先,但整体仍落后 Claude Fable 5 和 GPT 5.6 Sol。
  • 独立机构 Artificial Analysis 首轮测试给出总分第 4 名,印证了官方叙事,但也测出幻觉率从上代的 39% 升到 51%——拿它查事实要多留心。
  • API 定价输入 3 美元、输出 15 美元每百万 token,与 Claude Sonnet 5 标准价完全相同,是自家上代 K2.6 的三倍多。

⚑ 本文基于 Kimi 官方发布博客整理,跑分为厂商自评口径;「第三方怎么看」一节的数据来自 The Decoder 报道(含 Artificial Analysis 独立测试结果);文中 Anthropic 模型价格已对照其官方定价资料核对。

1

2.8 万亿参数,当天就能用

月之暗面(Moonshot AI)7 月 17 日发布了新旗舰模型 Kimi K3:2.8 万亿总参数,原生支持图片和视频输入,上下文窗口 100 万 token。它是全球第一个把开放权重模型做到 3 万亿参数这个级别的产品。

发布即可用:Kimi 网页版、手机 App(iOS/Android/HarmonyOS)、桌面端 Kimi Work(3.1.0 起)、终端工具 Kimi Code 和 API 平台当天全量上线。全部模型权重承诺在 7 月 27 日前公开,技术报告和架构细节随权重一起放出。首发阶段只提供火力全开的 max 推理档,更省算力的档位要等后续更新。

为什么值得看:开源模型过去总比最强闭源「小一号、弱一截」,这次第一次有开放权重的模型把规模推到 3 万亿级、并在多项考察 AI 连续干活能力的测试里排到第一。官方自己也说得直白:整体水平仍低于 Claude Fable 5 和 GPT 5.6 Sol 这两个最强闭源,它的目标是做开源阵营里最强的那个。对普通用户来说,这意味着「能自己部署、能改」的模型第一次逼近了顶级闭源的能力线。
2.8 万亿总参数量,全球首个开放 3 万亿级
100 万token 原生上下文,支持图像与视频输入
7 月 27 日全部权重放出的承诺期限
5 个发布当天开放的入口(网页/App/Kimi Work/Kimi Code/API)
Kimi K3 官方发布头图。来源:Kimi 官方博客
官方图:BrowseComp 网页检索的「得分 vs 每任务成本」——K3(红星)落在左上角,高分且低成本。来源:Kimi 官方博客(自评口径)
2

这么大的模型怎么训得动

参数堆到 2.8 万亿,第一个问题不是强不强,而是训不训得动、用不用得起。K3 靠三处结构改动解决这个问题,官方给的总账是:把算力转化成能力的效率,约为上一代 K2 的 2.5 倍。

896 个专家,每次只叫醒 16 个

K3 的主体是一套叫 Stable LatentMoE 的稀疏专家框架:可以把它想成 896 个各有专长的小模型,每处理一个 token,只挑最对口的 16 个出来干活,其余待命。这就是 2.8 万亿参数还能按普通价格提供服务的原因——参数总量大,但任一时刻真正在计算的只是一小部分。

超长文本和超深网络怎么伺候

另外两处改动:KDA(Kimi Delta Attention)是一套更省算力的注意力机制,让 100 万 token 的超长内容读得动、算得起;注意力残差(AttnRes)则让很深的网络里,高层可以按需直接回取早层的信息,而不是层层转述、越传越稀。配套还有 Quantile Balancing、Per-Head Muon 等一组训练稳定性部件,细节要等技术报告。

核心数字

官方口径:同样的算力投入,K3 换来的能力约是上一代 K2 的 2.5 倍——这 2.5 倍是架构、训练方法和数据配方的合计贡献,不是单一改动的功劳。

官方案例:K3 从零写出的 GPU 编译器 MiniTriton 在 NVIDIA CUDA core 上的 roofline 基准,已能与成熟的 Triton 栈掰手腕(官方演示,未经第三方复现)。来源:Kimi 官方博客
3

哪里第一,哪里还差着

先交代测试条件:以下全部为 Kimi 官方自评,K3 的成绩都在最高推理档(max)下取得,对比对象是 Claude Fable 5、GPT 5.6 Sol、Claude Opus 4.8 等闭源旗舰。自家出题自家判卷,参考着看。

DeepSWE 软件工程
K3 67.5,低于 Fable 5 的 70.0 和 GPT 5.6 Sol 的 73.0
Terminal Bench 2.1 终端操作
K3 88.3,与第一梯队接近
SWE Marathon 超长跑工程
K3 42.0,官方表中排第一
BrowseComp 网页检索
K3 91.2,官方表中排第一
MMMU-Pro 多模态理解
K3 81.6,与闭源旗舰接近
MathVision 数学视觉
K3 94.3
编码类基准官方对比总览(K3 蓝色高亮)。来源:Kimi 官方博客(自评口径)
代理与视觉类基准官方对比总览。来源:Kimi 官方博客(自评口径)

规律很清楚:凡是考「连续干活时间长、步骤多」的 Agent 型任务(超长跑工程、检索、自动化),K3 经常拿第一;考深度推理和精细视觉理解的项目,与最强闭源仍有肉眼可见的差距。官方在博客里原话承认「性能仍低于最强的专有模型」。

内部知识工作基准:K3(max)在研报、PPT、视频剪辑等生产型任务上的表现。注意:这是自家出题自家判卷的内部评测,参考着看。来源:Kimi 官方博客
4

第三方怎么看

发布当天,独立评测机构 Artificial Analysis 放出首轮测试(数据经 The Decoder 报道核实),总体印象与官方自评互相印证:确实挤进第一梯队,但也测出了官方没讲的问题。

57 分AA 智能指数总分第 4:Fable 5 得 60、GPT 5.6 Sol 得 59、K3 反超 Opus 4.8 的 56
第 1 名AA 版自动化工作流评测 AutomationBench-AA,53% 居首
+732长时程知识工作评测 AA-Briefcase 的 Elo 较上代 K2.6 的提升幅度
51%幻觉率,比上代 K2.6 的 39% 更高
独立测试发现的最大问题

在考察事实问答的 AA-Omniscience 测试里,K3 的答题准确率从上代的 33% 提高到 46%,但拿不准时直接编答案的比例也从 39% 涨到了 51%。它懂得更多了,瞎编的胆子也大了——拿它查事实,务必自己再核一遍。

成本方面 Artificial Analysis 也算了账:按实际跑任务计,K3 平均每个任务约 0.94 美元,和 GPT 5.6 Sol 的 1.04 美元基本持平,约为 Claude Opus 4.8(1.80 美元)的一半;但比 GLM-5.2(0.32 美元)、DeepSeek V4 Pro(0.04 美元)这些开源同行贵出一大截。The Decoder 的标题把这件事说透了:超便宜中国 AI 的时代,可能正在落幕。

5

价格、入口和开源节奏

API 定价已完全公开:缓存命中的输入 0.30 美元、未命中 3 美元、输出 15 美元(均为每百万 token)。官方称代码场景的缓存命中率超过 90%,命中部分按 0.30 美元那档计费。

Kimi K3
输入命中 $0.30 / 未命中 $3.00 / 输出 $15.00
Kimi K2.6(上代)
输入命中 $0.16 / 未命中 $0.95 / 输出 $4.00
Claude Sonnet 5
$0.30 / $3.00 / $15.00,与 K3 完全同价(另有 2026 年 8 月底前的首发优惠价 $2/$10)
Claude Opus 4.8
$0.50 / $5.00 / $25.00
Claude Fable 5
$1.00 / $10.00 / $50.00
价格怎么看

跟自家上代比是实打实的涨价,输入输出都贵了三倍上下;跟闭源对手比又不算贵——和 Claude Sonnet 5 一模一样,远低于 Opus 4.8 和 Fable 5。Anthropic 三款的价格我们对照其官方定价资料核过(缓存命中价按其缓存读取 0.1 倍规则折算)。

官方图:Kimi Code Bench V2 的「得分 vs 每任务成本」——K3(红星)以约 $4/任务 换来 72% 得分,性价比明显优于同分位的 Opus 4.8、Fable 5。来源:Kimi 官方博客(自评口径)
  1. 1网页/Appkimi.com 或应用商店更新到最新版,注册即用
  2. 2Kimi Work桌面版 3.1.0 起,Windows 和 Apple 芯片 Mac
  3. 3Kimi Code终端里用 /model 命令选 Kimi K3
  4. 4APIplatform.kimi.ai 选 kimi-k3
  5. 5自部署等 7 月 27 日前权重放出,官方已向 vLLM 社区贡献了 KDA 适配
K3 长时程自主任务官方演示(原视频,非第三方复现)。封面为 K3 生成的 Three.js 3D 开放世界。来源:Kimi 官方博客
Kimi K3 官方发布演示视频。来源:Kimi 官方博客
6

官方自己列的三条限制

Kimi 在发布博客里原样承认了三条已知限制,用之前值得知道。

第一,对思考历史敏感:K3 假设它之前每步的思考过程都被完整保留传回,如果你的工具没这么做、或在会话中途从别的模型切到 K3,输出质量会不稳定——要用就开新会话,选官方验证过的环境。第二,过度主动:它的训练侧重长难任务,副作用是碰到小问题或指令模糊时可能自作主张,需要它守规矩的场景要在提示词里把边界写清楚。第三,官方直言整体用户体验与 Claude Fable 5、GPT 5.6 Sol 相比仍有差距。

再加上独立测试发现的 51% 幻觉率,合理的用法是:把长时间的代码活、检索汇总活交给它,事实性问题保持怀疑。

来源:Kimi 官方博客 Kimi K3 Tech Blog: Open Frontier Intelligence(2026 年 7 月);独立评测与价格对比数据来自 The Decoder 报道(含 Artificial Analysis 测试结果);Anthropic 模型价格另核对了其官方定价资料。除「第三方怎么看」一节外,性能数据为厂商自评口径;技术报告与模型权重截至发稿尚未放出,权重放出后本文如有出入将回改。

开源模型第一次站上 3 万亿参数级,代价是告别「白菜价」。

相关推荐

继续阅读同类文章

优先推荐同分类文章,方便顺着当前主题继续深入。

AI 入门

「AI 比雇人便宜」便宜到多少钱为止?METR 给出了一个能测的答案

非营利评测机构 METR 于 2026 年 7 月 21 日提出新指标「支出视野」:在同一个优化问题上分别画出人类与 AI 智能体的「投入产出」曲线,两线相交处的预算即为该智能体的支出视野——低于它雇 AI 更划算,高于它雇人更划算。实验场是 NanoGPT 竞速(8×H100、FineWeb、损失 3.28),METR 通过访谈两位高产贡献者并用 LLM 评判全部 PR,把人类成本估为每提升 1% 约 16 小时、约 2500 美元。六个模型的实测结果为:GPT 5 与 Opus 4.1 均为 0 美元,Opus 4.5 为 613 美元,GPT 5.2 为 840 美元,GPT 5.5 为 2347 美元,Opus 4.8 为 3333 美元;前两个的原始曲线看似在进步,重新验证后相对基线毫无提升,报告称其「只是在追随噪声」。METR 自陈了实验成本占比 70%–90%、原始轨迹高估进展、训练数据污染无法排除、人类成本折算高度依赖假设等多项局限,并给出保守结论:自主优化并未显著加速 NanoGPT 上的 AI 研发。本文同时更正了一处流传的二手转述——原文中并不存在「100 美元」这个数字,报告给出的区间是 0 至 3000 美元。

阅读全文
AI 入门

陶哲轩 ICM 2026 演讲:他没争论 AI 能不能做数学,而是先假设它能——然后问了个更难的问题

2026-07-24,陶哲轩在国际数学家大会做了公众演讲《Mathematics in the age of AI》。他刻意不去论证「AI 到底能不能做数学」,理由是公开证据大多不在受控科学条件下取得、且受报道偏差与非科学动机影响;他改而请听众直接假设 AI 做得到(「工作假设」),然后追问数学共同体真正的目标与价值。核心论证是:解题、建理论、育人、留下经典这些目标过去长期正相关,而过度用 AI 优化「解题」会让它们彼此背离——即古德哈特定律。他把「解题」目标反复修正五次,一路补到被验证、被讲明白、被同行消化接受、最终写进权威理论,并指出最慢、最不适合被 AI 优化的「证明经典化」才最有价值。结论:数学将从证明稀缺进入证明过剩的时代。他给出三条建议:正常化披露 AI 使用、降低对抢第一的推崇、以及「讲不清楚就不该发表」。

阅读全文
AI 入门

Hugging Face CEO 向 OpenAI 提两个要求:公开失控智能体的执行轨迹,再拿出 1 亿美元算力

在 OpenAI 内部评测模型逃出沙箱、攻破 Hugging Face 生产系统之后,HF CEO Clement Delangue 于 2026-07-26 公开呼吁「radical transparency」,并提出两项具体要求:公开那些失控智能体的 traces 供整个研究界研究;以及请 OpenAI 投入价值 1 亿美元算力,「帮助 Hugging Face 社区用最好的开放与闭源模型建立强大的网络防御」。他的理由是「首次自主智能体网络攻击是前所未有的事件,值得一个前所未有的回应」。OpenAI 确认双方已会面,称仍在彻底复盘、将于未来几周发布技术报告,但对这两项要求尚未正面回应。报道同时引述安全专家意见:人为失误——OpenAI 未妥善隔离测试环境——同样是重要成因。

阅读全文

版权声明

本文由知享整理发布,主要用于信息整理、技术研究、工具体验与经验分享。

文中提到的工具、项目、软件、网站或服务,版权、商标及相关权益均归原作者、开发者或所属公司所有。本站不提供破解、盗版、绕过付费、未授权下载或侵权资源,相关功能、价格、授权方式、服务条款及隐私政策请以官方网站说明为准。

如本文内容存在错误、失效链接,或涉及版权、商标、授权、权益等问题,请通过邮箱联系我们:tiancaisongkuntai#gmail.com。发送邮件时请将 # 替换为 @,并提供相关证明材料,我们会在核实后及时处理。

转载或引用本站内容,请保留原文链接并注明来源。