一分钟速览
- 月之暗面 7 月 17 日发布新旗舰 Kimi K3:2.8 万亿参数、原生看图看视频、一次读 100 万 token,是全球第一个开放权重做到 3 万亿参数级的模型。
- 网页、App、Kimi Work、Kimi Code 和 API 当天全量可用;全部模型权重承诺 7 月 27 日前公开,技术报告随权重发布。
- 官方自评里它在「长时间连续干活」类测试(超长跑软件工程、网页检索、自动化)多项领先,但整体仍落后 Claude Fable 5 和 GPT 5.6 Sol。
- 独立机构 Artificial Analysis 首轮测试给出总分第 4 名,印证了官方叙事,但也测出幻觉率从上代的 39% 升到 51%——拿它查事实要多留心。
- API 定价输入 3 美元、输出 15 美元每百万 token,与 Claude Sonnet 5 标准价完全相同,是自家上代 K2.6 的三倍多。
⚑ 本文基于 Kimi 官方发布博客整理,跑分为厂商自评口径;「第三方怎么看」一节的数据来自 The Decoder 报道(含 Artificial Analysis 独立测试结果);文中 Anthropic 模型价格已对照其官方定价资料核对。
2.8 万亿参数,当天就能用
月之暗面(Moonshot AI)7 月 17 日发布了新旗舰模型 Kimi K3:2.8 万亿总参数,原生支持图片和视频输入,上下文窗口 100 万 token。它是全球第一个把开放权重模型做到 3 万亿参数这个级别的产品。
发布即可用:Kimi 网页版、手机 App(iOS/Android/HarmonyOS)、桌面端 Kimi Work(3.1.0 起)、终端工具 Kimi Code 和 API 平台当天全量上线。全部模型权重承诺在 7 月 27 日前公开,技术报告和架构细节随权重一起放出。首发阶段只提供火力全开的 max 推理档,更省算力的档位要等后续更新。


这么大的模型怎么训得动
参数堆到 2.8 万亿,第一个问题不是强不强,而是训不训得动、用不用得起。K3 靠三处结构改动解决这个问题,官方给的总账是:把算力转化成能力的效率,约为上一代 K2 的 2.5 倍。
896 个专家,每次只叫醒 16 个
K3 的主体是一套叫 Stable LatentMoE 的稀疏专家框架:可以把它想成 896 个各有专长的小模型,每处理一个 token,只挑最对口的 16 个出来干活,其余待命。这就是 2.8 万亿参数还能按普通价格提供服务的原因——参数总量大,但任一时刻真正在计算的只是一小部分。
超长文本和超深网络怎么伺候
另外两处改动:KDA(Kimi Delta Attention)是一套更省算力的注意力机制,让 100 万 token 的超长内容读得动、算得起;注意力残差(AttnRes)则让很深的网络里,高层可以按需直接回取早层的信息,而不是层层转述、越传越稀。配套还有 Quantile Balancing、Per-Head Muon 等一组训练稳定性部件,细节要等技术报告。
官方口径:同样的算力投入,K3 换来的能力约是上一代 K2 的 2.5 倍——这 2.5 倍是架构、训练方法和数据配方的合计贡献,不是单一改动的功劳。
哪里第一,哪里还差着
先交代测试条件:以下全部为 Kimi 官方自评,K3 的成绩都在最高推理档(max)下取得,对比对象是 Claude Fable 5、GPT 5.6 Sol、Claude Opus 4.8 等闭源旗舰。自家出题自家判卷,参考着看。
- DeepSWE 软件工程
- K3 67.5,低于 Fable 5 的 70.0 和 GPT 5.6 Sol 的 73.0
- Terminal Bench 2.1 终端操作
- K3 88.3,与第一梯队接近
- SWE Marathon 超长跑工程
- K3 42.0,官方表中排第一
- BrowseComp 网页检索
- K3 91.2,官方表中排第一
- MMMU-Pro 多模态理解
- K3 81.6,与闭源旗舰接近
- MathVision 数学视觉
- K3 94.3


规律很清楚:凡是考「连续干活时间长、步骤多」的 Agent 型任务(超长跑工程、检索、自动化),K3 经常拿第一;考深度推理和精细视觉理解的项目,与最强闭源仍有肉眼可见的差距。官方在博客里原话承认「性能仍低于最强的专有模型」。

第三方怎么看
发布当天,独立评测机构 Artificial Analysis 放出首轮测试(数据经 The Decoder 报道核实),总体印象与官方自评互相印证:确实挤进第一梯队,但也测出了官方没讲的问题。
在考察事实问答的 AA-Omniscience 测试里,K3 的答题准确率从上代的 33% 提高到 46%,但拿不准时直接编答案的比例也从 39% 涨到了 51%。它懂得更多了,瞎编的胆子也大了——拿它查事实,务必自己再核一遍。
成本方面 Artificial Analysis 也算了账:按实际跑任务计,K3 平均每个任务约 0.94 美元,和 GPT 5.6 Sol 的 1.04 美元基本持平,约为 Claude Opus 4.8(1.80 美元)的一半;但比 GLM-5.2(0.32 美元)、DeepSeek V4 Pro(0.04 美元)这些开源同行贵出一大截。The Decoder 的标题把这件事说透了:超便宜中国 AI 的时代,可能正在落幕。
价格、入口和开源节奏
API 定价已完全公开:缓存命中的输入 0.30 美元、未命中 3 美元、输出 15 美元(均为每百万 token)。官方称代码场景的缓存命中率超过 90%,命中部分按 0.30 美元那档计费。
- Kimi K3
- 输入命中 $0.30 / 未命中 $3.00 / 输出 $15.00
- Kimi K2.6(上代)
- 输入命中 $0.16 / 未命中 $0.95 / 输出 $4.00
- Claude Sonnet 5
- $0.30 / $3.00 / $15.00,与 K3 完全同价(另有 2026 年 8 月底前的首发优惠价 $2/$10)
- Claude Opus 4.8
- $0.50 / $5.00 / $25.00
- Claude Fable 5
- $1.00 / $10.00 / $50.00
跟自家上代比是实打实的涨价,输入输出都贵了三倍上下;跟闭源对手比又不算贵——和 Claude Sonnet 5 一模一样,远低于 Opus 4.8 和 Fable 5。Anthropic 三款的价格我们对照其官方定价资料核过(缓存命中价按其缓存读取 0.1 倍规则折算)。

- 1网页/Appkimi.com 或应用商店更新到最新版,注册即用
- 2Kimi Work桌面版 3.1.0 起,Windows 和 Apple 芯片 Mac
- 3Kimi Code终端里用 /model 命令选 Kimi K3
- 4APIplatform.kimi.ai 选 kimi-k3
- 5自部署等 7 月 27 日前权重放出,官方已向 vLLM 社区贡献了 KDA 适配
官方自己列的三条限制
Kimi 在发布博客里原样承认了三条已知限制,用之前值得知道。
第一,对思考历史敏感:K3 假设它之前每步的思考过程都被完整保留传回,如果你的工具没这么做、或在会话中途从别的模型切到 K3,输出质量会不稳定——要用就开新会话,选官方验证过的环境。第二,过度主动:它的训练侧重长难任务,副作用是碰到小问题或指令模糊时可能自作主张,需要它守规矩的场景要在提示词里把边界写清楚。第三,官方直言整体用户体验与 Claude Fable 5、GPT 5.6 Sol 相比仍有差距。
再加上独立测试发现的 51% 幻觉率,合理的用法是:把长时间的代码活、检索汇总活交给它,事实性问题保持怀疑。
来源:Kimi 官方博客 Kimi K3 Tech Blog: Open Frontier Intelligence(2026 年 7 月);独立评测与价格对比数据来自 The Decoder 报道(含 Artificial Analysis 测试结果);Anthropic 模型价格另核对了其官方定价资料。除「第三方怎么看」一节外,性能数据为厂商自评口径;技术报告与模型权重截至发稿尚未放出,权重放出后本文如有出入将回改。
开源模型第一次站上 3 万亿参数级,代价是告别「白菜价」。

