一分钟速览
- 知名 AI 博主 Simon Willison 用他的「鹈鹕骑自行车」趣味基准测试 Kimi K3 时,发现一个异常:只发一个词「hi」,API 却报告输入用了 86 个 token。
- 对账推断:K3 的 API 里大概率注入了一段约 85 个 token 的隐藏系统提示词,同样的提示词在 OpenAI 分词器下只算 10 个 token;模型本身拒绝透露这段内容。
- 测试经由 OpenRouter 转接调用,注入发生在哪一层(模型服务端还是中转层)无法完全确认,官方也未回应。
- 顺带实测了 K3 的真实成本:画一只 SVG 鹈鹕花了 0.25 美元——16658 个输出 token 里有 13241 个是推理 token,印证了首发只有 max 推理档的「火力全开」计费。
- 对普通用户的提醒:按 token 计费时,你可能在为看不见的内容付钱;更重要的是,隐藏注入会让不同模型的「跑分对比」失去可比性。
⚑ 本文基于 Simon Willison 的博客原文整理(其测试经由 OpenRouter API 进行),Kimi K3 定价与推理档信息另与 Kimi 官方博客交叉核对;隐藏提示词的具体内容与注入环节截至发稿无官方说法,文中相关表述均为基于 token 计数的推断。
一句「hi」,怎么变成 86 个 token
Kimi K3 发布次日,Simon Willison——就是那位用「让模型画一只骑自行车的鹈鹕」来快测每个新模型的英国开发者——照例把 K3 拉出来遛了一圈。鹈鹕画得不错,比上代 Kimi 模型明显进步,但他注意到一个不对劲的数字:那句只有十来个词的画图提示词,K3 的 API 报告输入用了 95 个 token。
作为对照,同样的提示词用 OpenAI 的分词器数只有 10 个 token,Claude 系列也在相近量级。分词器不同会带来一些差异,但差不出 9 倍。为了排除干扰,他又发了一个最短的测试——只有一个词「hi」——API 报告:86 个输入 token。

85 个 token 是怎么算出来的
推断过程就是简单的减法:「hi」本身怎么分词也就 1 个 token 左右,86 减去它,剩下约 85 个 token 属于用户看不见的内容。结合鹈鹕提示词那次 95 对 10 的差值(同样多出约 85),两次测试互相印证,指向一段固定长度的隐藏注入。
Simon 试着直接问模型这段提示词是什么,被拒绝了。从内容长度和 K3 首发「只有 max 推理档」的特征推测,这段注入很可能与推理力度控制有关——但这只是合理猜测,不是证据。
有一个环节必须说清:这次测试是经由 OpenRouter(一个聚合多家模型的中转平台)调用的,不是直连 Kimi 官方 API。注入发生在 Moonshot 的服务端还是中转链路上,外部无法完全区分,截至发稿双方都没有回应。结论应该收窄为:「经 OpenRouter 调用 Kimi K3 时,存在约 85 token 的不可见输入」。
顺带测出的真实成本账
这次测试还留下一份有参考价值的成本记录,和本站此前根据官方博客整理的定价信息对得上(输入 3 美元、输出 15 美元每百万 token,仅 max 推理档)。
- 画一只 SVG 鹈鹕
- 输出 16658 token,其中 13241 个是推理 token,成本 $0.25
- 让 K3 看图写替代文本
- 输入 822 token、输出 243 token,成本约 0.6 美分
- 推理 token 占比
- 约 79%——max 档「火力全开」意味着大部分费用花在你看不到的思考过程上
- 视觉能力
- Simon 评价 K3 生成的图片替代文本「非常优秀」
一次简单的画图请求花 0.25 美元,其中近八成 token 是推理过程。K3 当前没有更省的档位可选,轻量任务的单价会显得偏高——这与本站 K3 发布文章里「首发只提供 max 档」的信息互相印证,等后续低档位推出后会有改善空间。
趣味基准和跑分,都要打折看
最后是 Simon 自己对「鹈鹕基准」的清醒说明,值得原样转达:这个测试是 21 个月前的一个玩笑,最大的局限是完全不考察今天最关键的能力——Agent 式的工具调用;它的价值在于强迫你真的去用一遍模型、暴露一些有趣的特性、以及在同一系列模型之间做版本对比。
把这件事和本站此前的 K3 报道放在一起看,给普通读者的可带走结论是一致的:厂商自评跑分有口径、独立趣味测试有局限、API 里还可能有看不见的注入——评价一个模型,多个来源交叉着看,永远比信任任何单一数字可靠。
来源:Simon Willison 博客 Kimi K3(2026 年 7 月 16 日,测试经由 OpenRouter API);Kimi K3 定价与推理档信息与 Kimi 官方博客交叉核对(详见本站《Kimi K3 发布》一文)。隐藏提示词的长度为基于 token 计数的推断,其具体内容与注入环节截至发稿无官方说法;选题线索来自 Hacker News 相关讨论,本文未转述未经核实的评论观点。
API 不再是裸通道:你付费的 token 里,可能有一段你看不见的话。

