返回文章列表
文章详情AI 入门

一句「hi」被计成 86 个 token:Kimi K3 API 里疑有约 85 token 的隐藏提示词

Simon Willison 用鹈鹕基准实测 Kimi K3 时发现 token 计数异常:最短输入也多出约 85 个 token,疑为 API 层隐藏系统提示词;测试同时留下一份真实成本账——画一只鹈鹕 0.25 美元、推理 token 占近八成。注入环节尚无官方说法,本文按推断口径如实梳理。

更新于 2026-07-185 分钟4

一分钟速览

  • 知名 AI 博主 Simon Willison 用他的「鹈鹕骑自行车」趣味基准测试 Kimi K3 时,发现一个异常:只发一个词「hi」,API 却报告输入用了 86 个 token。
  • 对账推断:K3 的 API 里大概率注入了一段约 85 个 token 的隐藏系统提示词,同样的提示词在 OpenAI 分词器下只算 10 个 token;模型本身拒绝透露这段内容。
  • 测试经由 OpenRouter 转接调用,注入发生在哪一层(模型服务端还是中转层)无法完全确认,官方也未回应。
  • 顺带实测了 K3 的真实成本:画一只 SVG 鹈鹕花了 0.25 美元——16658 个输出 token 里有 13241 个是推理 token,印证了首发只有 max 推理档的「火力全开」计费。
  • 对普通用户的提醒:按 token 计费时,你可能在为看不见的内容付钱;更重要的是,隐藏注入会让不同模型的「跑分对比」失去可比性。

⚑ 本文基于 Simon Willison 的博客原文整理(其测试经由 OpenRouter API 进行),Kimi K3 定价与推理档信息另与 Kimi 官方博客交叉核对;隐藏提示词的具体内容与注入环节截至发稿无官方说法,文中相关表述均为基于 token 计数的推断。

1

一句「hi」,怎么变成 86 个 token

Kimi K3 发布次日,Simon Willison——就是那位用「让模型画一只骑自行车的鹈鹕」来快测每个新模型的英国开发者——照例把 K3 拉出来遛了一圈。鹈鹕画得不错,比上代 Kimi 模型明显进步,但他注意到一个不对劲的数字:那句只有十来个词的画图提示词,K3 的 API 报告输入用了 95 个 token。

作为对照,同样的提示词用 OpenAI 的分词器数只有 10 个 token,Claude 系列也在相近量级。分词器不同会带来一些差异,但差不出 9 倍。为了排除干扰,他又发了一个最短的测试——只有一个词「hi」——API 报告:86 个输入 token。

K3 生成的「鹈鹕骑自行车」SVG 实物(渲染截图)。就是画这只鹈鹕的提示词,让作者发现了 token 计数异常。来源:Simon Willison 博客
为什么值得看:隐藏系统提示词本身在行业里不算新鲜事(厂商常用它控制推理档位、安全边界等),但它通常发生在网页版和 App 里;API 被默认视为「你发什么模型收什么」的裸通道,开发者按这个假设计费、做评测。一旦 API 层也有看不见的注入,按 token 付费的账单和跨模型的基准对比就都掺了变量——这正是这次发现引发讨论的原因。
86发送「hi」时 K3 API 报告的输入 token 数
10同样内容在 OpenAI 分词器下的计数
≈85据此推断的隐藏系统提示词长度
$0.25画一只 SVG 鹈鹕的实测 API 成本
2

85 个 token 是怎么算出来的

推断过程就是简单的减法:「hi」本身怎么分词也就 1 个 token 左右,86 减去它,剩下约 85 个 token 属于用户看不见的内容。结合鹈鹕提示词那次 95 对 10 的差值(同样多出约 85),两次测试互相印证,指向一段固定长度的隐藏注入。

Simon 试着直接问模型这段提示词是什么,被拒绝了。从内容长度和 K3 首发「只有 max 推理档」的特征推测,这段注入很可能与推理力度控制有关——但这只是合理猜测,不是证据。

归因要谨慎

有一个环节必须说清:这次测试是经由 OpenRouter(一个聚合多家模型的中转平台)调用的,不是直连 Kimi 官方 API。注入发生在 Moonshot 的服务端还是中转链路上,外部无法完全区分,截至发稿双方都没有回应。结论应该收窄为:「经 OpenRouter 调用 Kimi K3 时,存在约 85 token 的不可见输入」。

3

顺带测出的真实成本账

这次测试还留下一份有参考价值的成本记录,和本站此前根据官方博客整理的定价信息对得上(输入 3 美元、输出 15 美元每百万 token,仅 max 推理档)。

画一只 SVG 鹈鹕
输出 16658 token,其中 13241 个是推理 token,成本 $0.25
让 K3 看图写替代文本
输入 822 token、输出 243 token,成本约 0.6 美分
推理 token 占比
约 79%——max 档「火力全开」意味着大部分费用花在你看不到的思考过程上
视觉能力
Simon 评价 K3 生成的图片替代文本「非常优秀」
费用的直观感受

一次简单的画图请求花 0.25 美元,其中近八成 token 是推理过程。K3 当前没有更省的档位可选,轻量任务的单价会显得偏高——这与本站 K3 发布文章里「首发只提供 max 档」的信息互相印证,等后续低档位推出后会有改善空间。

4

趣味基准和跑分,都要打折看

最后是 Simon 自己对「鹈鹕基准」的清醒说明,值得原样转达:这个测试是 21 个月前的一个玩笑,最大的局限是完全不考察今天最关键的能力——Agent 式的工具调用;它的价值在于强迫你真的去用一遍模型、暴露一些有趣的特性、以及在同一系列模型之间做版本对比。

把这件事和本站此前的 K3 报道放在一起看,给普通读者的可带走结论是一致的:厂商自评跑分有口径、独立趣味测试有局限、API 里还可能有看不见的注入——评价一个模型,多个来源交叉着看,永远比信任任何单一数字可靠。

来源:Simon Willison 博客 Kimi K3(2026 年 7 月 16 日,测试经由 OpenRouter API);Kimi K3 定价与推理档信息与 Kimi 官方博客交叉核对(详见本站《Kimi K3 发布》一文)。隐藏提示词的长度为基于 token 计数的推断,其具体内容与注入环节截至发稿无官方说法;选题线索来自 Hacker News 相关讨论,本文未转述未经核实的评论观点。

API 不再是裸通道:你付费的 token 里,可能有一段你看不见的话。

相关推荐

继续阅读同类文章

优先推荐同分类文章,方便顺着当前主题继续深入。

AI 入门

阿里预览 Qwen 3.8:2.4 万亿参数紧追 Kimi K3,但目前只有一条推文

阿里 7 月 19 日通过官方社交账号预告 2.4 万亿参数、原生多模态的 Qwen 3.8,紧跟几天前的 Kimi K3。但截至发稿只有一条预告:没有官方博客、模型卡、跑分表,连开源日期都没给,「仅次于 Fable 5」的自评也无数据支撑。本文把「官方确认」和「尚未证实」分清楚,冷静看待这次卡位。

阅读全文
AI 入门

Kimi K3 发布:2.8 万亿参数的开源模型,价格追平 Claude Sonnet 5

月之暗面发布全球首个 3 万亿参数级开放模型 Kimi K3:多项长时程 Agent 测试第一、当天全渠道可用、权重 7 月 27 日前公开;独立测试印证实力的同时也测出幻觉率升到 51%,定价则告别了中国开源模型的「白菜价」时代。

阅读全文
AI 入门

免费 AI 工具到底安不安全?先看这 4 件事

免费不等于零风险,真实代价写在隐私条款和授权规则里。上传前分清内容边界,商用前找到授权页,免费额度当试吃别当正餐。

阅读全文

版权声明

本文由知享整理发布,主要用于信息整理、技术研究、工具体验与经验分享。

文中提到的工具、项目、软件、网站或服务,版权、商标及相关权益均归原作者、开发者或所属公司所有。本站不提供破解、盗版、绕过付费、未授权下载或侵权资源,相关功能、价格、授权方式、服务条款及隐私政策请以官方网站说明为准。

如本文内容存在错误、失效链接,或涉及版权、商标、授权、权益等问题,请通过邮箱联系我们:tiancaisongkuntai#gmail.com。发送邮件时请将 # 替换为 @,并提供相关证明材料,我们会在核实后及时处理。

转载或引用本站内容,请保留原文链接并注明来源。