返回文章列表
文章详情AI 入门

Kimi K3 发布:2.8 万亿参数的开源模型,价格追平 Claude Sonnet 5

月之暗面发布全球首个 3 万亿参数级开放模型 Kimi K3:多项长时程 Agent 测试第一、当天全渠道可用、权重 7 月 27 日前公开;独立测试印证实力的同时也测出幻觉率升到 51%,定价则告别了中国开源模型的「白菜价」时代。

更新于 2026-07-175 分钟6

一分钟速览

  • 月之暗面 7 月 17 日发布新旗舰 Kimi K3:2.8 万亿参数、原生看图看视频、一次读 100 万 token,是全球第一个开放权重做到 3 万亿参数级的模型。
  • 网页、App、Kimi Work、Kimi Code 和 API 当天全量可用;全部模型权重承诺 7 月 27 日前公开,技术报告随权重发布。
  • 官方自评里它在「长时间连续干活」类测试(超长跑软件工程、网页检索、自动化)多项领先,但整体仍落后 Claude Fable 5 和 GPT 5.6 Sol。
  • 独立机构 Artificial Analysis 首轮测试给出总分第 4 名,印证了官方叙事,但也测出幻觉率从上代的 39% 升到 51%——拿它查事实要多留心。
  • API 定价输入 3 美元、输出 15 美元每百万 token,与 Claude Sonnet 5 标准价完全相同,是自家上代 K2.6 的三倍多。

⚑ 本文基于 Kimi 官方发布博客整理,跑分为厂商自评口径;「第三方怎么看」一节的数据来自 The Decoder 报道(含 Artificial Analysis 独立测试结果);文中 Anthropic 模型价格已对照其官方定价资料核对。

1

2.8 万亿参数,当天就能用

月之暗面(Moonshot AI)7 月 17 日发布了新旗舰模型 Kimi K3:2.8 万亿总参数,原生支持图片和视频输入,上下文窗口 100 万 token。它是全球第一个把开放权重模型做到 3 万亿参数这个级别的产品。

发布即可用:Kimi 网页版、手机 App(iOS/Android/HarmonyOS)、桌面端 Kimi Work(3.1.0 起)、终端工具 Kimi Code 和 API 平台当天全量上线。全部模型权重承诺在 7 月 27 日前公开,技术报告和架构细节随权重一起放出。首发阶段只提供火力全开的 max 推理档,更省算力的档位要等后续更新。

为什么值得看:开源模型过去总比最强闭源「小一号、弱一截」,这次第一次有开放权重的模型把规模推到 3 万亿级、并在多项考察 AI 连续干活能力的测试里排到第一。官方自己也说得直白:整体水平仍低于 Claude Fable 5 和 GPT 5.6 Sol 这两个最强闭源,它的目标是做开源阵营里最强的那个。对普通用户来说,这意味着「能自己部署、能改」的模型第一次逼近了顶级闭源的能力线。
2.8 万亿总参数量,全球首个开放 3 万亿级
100 万token 原生上下文,支持图像与视频输入
7 月 27 日全部权重放出的承诺期限
5 个发布当天开放的入口(网页/App/Kimi Work/Kimi Code/API)
Kimi K3 官方发布头图。来源:Kimi 官方博客
官方图:BrowseComp 网页检索的「得分 vs 每任务成本」——K3(红星)落在左上角,高分且低成本。来源:Kimi 官方博客(自评口径)
2

这么大的模型怎么训得动

参数堆到 2.8 万亿,第一个问题不是强不强,而是训不训得动、用不用得起。K3 靠三处结构改动解决这个问题,官方给的总账是:把算力转化成能力的效率,约为上一代 K2 的 2.5 倍。

896 个专家,每次只叫醒 16 个

K3 的主体是一套叫 Stable LatentMoE 的稀疏专家框架:可以把它想成 896 个各有专长的小模型,每处理一个 token,只挑最对口的 16 个出来干活,其余待命。这就是 2.8 万亿参数还能按普通价格提供服务的原因——参数总量大,但任一时刻真正在计算的只是一小部分。

超长文本和超深网络怎么伺候

另外两处改动:KDA(Kimi Delta Attention)是一套更省算力的注意力机制,让 100 万 token 的超长内容读得动、算得起;注意力残差(AttnRes)则让很深的网络里,高层可以按需直接回取早层的信息,而不是层层转述、越传越稀。配套还有 Quantile Balancing、Per-Head Muon 等一组训练稳定性部件,细节要等技术报告。

核心数字

官方口径:同样的算力投入,K3 换来的能力约是上一代 K2 的 2.5 倍——这 2.5 倍是架构、训练方法和数据配方的合计贡献,不是单一改动的功劳。

官方案例:K3 从零写出的 GPU 编译器 MiniTriton 在 NVIDIA CUDA core 上的 roofline 基准,已能与成熟的 Triton 栈掰手腕(官方演示,未经第三方复现)。来源:Kimi 官方博客
3

哪里第一,哪里还差着

先交代测试条件:以下全部为 Kimi 官方自评,K3 的成绩都在最高推理档(max)下取得,对比对象是 Claude Fable 5、GPT 5.6 Sol、Claude Opus 4.8 等闭源旗舰。自家出题自家判卷,参考着看。

DeepSWE 软件工程
K3 67.5,低于 Fable 5 的 70.0 和 GPT 5.6 Sol 的 73.0
Terminal Bench 2.1 终端操作
K3 88.3,与第一梯队接近
SWE Marathon 超长跑工程
K3 42.0,官方表中排第一
BrowseComp 网页检索
K3 91.2,官方表中排第一
MMMU-Pro 多模态理解
K3 81.6,与闭源旗舰接近
MathVision 数学视觉
K3 94.3
编码类基准官方对比总览(K3 蓝色高亮)。来源:Kimi 官方博客(自评口径)
代理与视觉类基准官方对比总览。来源:Kimi 官方博客(自评口径)

规律很清楚:凡是考「连续干活时间长、步骤多」的 Agent 型任务(超长跑工程、检索、自动化),K3 经常拿第一;考深度推理和精细视觉理解的项目,与最强闭源仍有肉眼可见的差距。官方在博客里原话承认「性能仍低于最强的专有模型」。

内部知识工作基准:K3(max)在研报、PPT、视频剪辑等生产型任务上的表现。注意:这是自家出题自家判卷的内部评测,参考着看。来源:Kimi 官方博客
4

第三方怎么看

发布当天,独立评测机构 Artificial Analysis 放出首轮测试(数据经 The Decoder 报道核实),总体印象与官方自评互相印证:确实挤进第一梯队,但也测出了官方没讲的问题。

57 分AA 智能指数总分第 4:Fable 5 得 60、GPT 5.6 Sol 得 59、K3 反超 Opus 4.8 的 56
第 1 名AA 版自动化工作流评测 AutomationBench-AA,53% 居首
+732长时程知识工作评测 AA-Briefcase 的 Elo 较上代 K2.6 的提升幅度
51%幻觉率,比上代 K2.6 的 39% 更高
独立测试发现的最大问题

在考察事实问答的 AA-Omniscience 测试里,K3 的答题准确率从上代的 33% 提高到 46%,但拿不准时直接编答案的比例也从 39% 涨到了 51%。它懂得更多了,瞎编的胆子也大了——拿它查事实,务必自己再核一遍。

成本方面 Artificial Analysis 也算了账:按实际跑任务计,K3 平均每个任务约 0.94 美元,和 GPT 5.6 Sol 的 1.04 美元基本持平,约为 Claude Opus 4.8(1.80 美元)的一半;但比 GLM-5.2(0.32 美元)、DeepSeek V4 Pro(0.04 美元)这些开源同行贵出一大截。The Decoder 的标题把这件事说透了:超便宜中国 AI 的时代,可能正在落幕。

5

价格、入口和开源节奏

API 定价已完全公开:缓存命中的输入 0.30 美元、未命中 3 美元、输出 15 美元(均为每百万 token)。官方称代码场景的缓存命中率超过 90%,命中部分按 0.30 美元那档计费。

Kimi K3
输入命中 $0.30 / 未命中 $3.00 / 输出 $15.00
Kimi K2.6(上代)
输入命中 $0.16 / 未命中 $0.95 / 输出 $4.00
Claude Sonnet 5
$0.30 / $3.00 / $15.00,与 K3 完全同价(另有 2026 年 8 月底前的首发优惠价 $2/$10)
Claude Opus 4.8
$0.50 / $5.00 / $25.00
Claude Fable 5
$1.00 / $10.00 / $50.00
价格怎么看

跟自家上代比是实打实的涨价,输入输出都贵了三倍上下;跟闭源对手比又不算贵——和 Claude Sonnet 5 一模一样,远低于 Opus 4.8 和 Fable 5。Anthropic 三款的价格我们对照其官方定价资料核过(缓存命中价按其缓存读取 0.1 倍规则折算)。

官方图:Kimi Code Bench V2 的「得分 vs 每任务成本」——K3(红星)以约 $4/任务 换来 72% 得分,性价比明显优于同分位的 Opus 4.8、Fable 5。来源:Kimi 官方博客(自评口径)
  1. 1网页/Appkimi.com 或应用商店更新到最新版,注册即用
  2. 2Kimi Work桌面版 3.1.0 起,Windows 和 Apple 芯片 Mac
  3. 3Kimi Code终端里用 /model 命令选 Kimi K3
  4. 4APIplatform.kimi.ai 选 kimi-k3
  5. 5自部署等 7 月 27 日前权重放出,官方已向 vLLM 社区贡献了 KDA 适配
K3 长时程自主任务官方演示(原视频,非第三方复现)。封面为 K3 生成的 Three.js 3D 开放世界。来源:Kimi 官方博客
Kimi K3 官方发布演示视频。来源:Kimi 官方博客
6

官方自己列的三条限制

Kimi 在发布博客里原样承认了三条已知限制,用之前值得知道。

第一,对思考历史敏感:K3 假设它之前每步的思考过程都被完整保留传回,如果你的工具没这么做、或在会话中途从别的模型切到 K3,输出质量会不稳定——要用就开新会话,选官方验证过的环境。第二,过度主动:它的训练侧重长难任务,副作用是碰到小问题或指令模糊时可能自作主张,需要它守规矩的场景要在提示词里把边界写清楚。第三,官方直言整体用户体验与 Claude Fable 5、GPT 5.6 Sol 相比仍有差距。

再加上独立测试发现的 51% 幻觉率,合理的用法是:把长时间的代码活、检索汇总活交给它,事实性问题保持怀疑。

来源:Kimi 官方博客 Kimi K3 Tech Blog: Open Frontier Intelligence(2026 年 7 月);独立评测与价格对比数据来自 The Decoder 报道(含 Artificial Analysis 测试结果);Anthropic 模型价格另核对了其官方定价资料。除「第三方怎么看」一节外,性能数据为厂商自评口径;技术报告与模型权重截至发稿尚未放出,权重放出后本文如有出入将回改。

开源模型第一次站上 3 万亿参数级,代价是告别「白菜价」。

相关推荐

继续阅读同类文章

优先推荐同分类文章,方便顺着当前主题继续深入。

AI 入门

阿里预览 Qwen 3.8:2.4 万亿参数紧追 Kimi K3,但目前只有一条推文

阿里 7 月 19 日通过官方社交账号预告 2.4 万亿参数、原生多模态的 Qwen 3.8,紧跟几天前的 Kimi K3。但截至发稿只有一条预告:没有官方博客、模型卡、跑分表,连开源日期都没给,「仅次于 Fable 5」的自评也无数据支撑。本文把「官方确认」和「尚未证实」分清楚,冷静看待这次卡位。

阅读全文
AI 入门

一句「hi」被计成 86 个 token:Kimi K3 API 里疑有约 85 token 的隐藏提示词

Simon Willison 用鹈鹕基准实测 Kimi K3 时发现 token 计数异常:最短输入也多出约 85 个 token,疑为 API 层隐藏系统提示词;测试同时留下一份真实成本账——画一只鹈鹕 0.25 美元、推理 token 占近八成。注入环节尚无官方说法,本文按推断口径如实梳理。

阅读全文
AI 入门

免费 AI 工具到底安不安全?先看这 4 件事

免费不等于零风险,真实代价写在隐私条款和授权规则里。上传前分清内容边界,商用前找到授权页,免费额度当试吃别当正餐。

阅读全文

版权声明

本文由知享整理发布,主要用于信息整理、技术研究、工具体验与经验分享。

文中提到的工具、项目、软件、网站或服务,版权、商标及相关权益均归原作者、开发者或所属公司所有。本站不提供破解、盗版、绕过付费、未授权下载或侵权资源,相关功能、价格、授权方式、服务条款及隐私政策请以官方网站说明为准。

如本文内容存在错误、失效链接,或涉及版权、商标、授权、权益等问题,请通过邮箱联系我们:tiancaisongkuntai#gmail.com。发送邮件时请将 # 替换为 @,并提供相关证明材料,我们会在核实后及时处理。

转载或引用本站内容,请保留原文链接并注明来源。