返回文章列表
文章详情AI 入门

一句「hi」被计成 86 个 token:Kimi K3 API 里疑有约 85 token 的隐藏提示词

Simon Willison 用鹈鹕基准实测 Kimi K3 时发现 token 计数异常:最短输入也多出约 85 个 token,疑为 API 层隐藏系统提示词;测试同时留下一份真实成本账——画一只鹈鹕 0.25 美元、推理 token 占近八成。注入环节尚无官方说法,本文按推断口径如实梳理。

更新于 2026-07-185 分钟4

一分钟速览

  • 知名 AI 博主 Simon Willison 用他的「鹈鹕骑自行车」趣味基准测试 Kimi K3 时,发现一个异常:只发一个词「hi」,API 却报告输入用了 86 个 token。
  • 对账推断:K3 的 API 里大概率注入了一段约 85 个 token 的隐藏系统提示词,同样的提示词在 OpenAI 分词器下只算 10 个 token;模型本身拒绝透露这段内容。
  • 测试经由 OpenRouter 转接调用,注入发生在哪一层(模型服务端还是中转层)无法完全确认,官方也未回应。
  • 顺带实测了 K3 的真实成本:画一只 SVG 鹈鹕花了 0.25 美元——16658 个输出 token 里有 13241 个是推理 token,印证了首发只有 max 推理档的「火力全开」计费。
  • 对普通用户的提醒:按 token 计费时,你可能在为看不见的内容付钱;更重要的是,隐藏注入会让不同模型的「跑分对比」失去可比性。

⚑ 本文基于 Simon Willison 的博客原文整理(其测试经由 OpenRouter API 进行),Kimi K3 定价与推理档信息另与 Kimi 官方博客交叉核对;隐藏提示词的具体内容与注入环节截至发稿无官方说法,文中相关表述均为基于 token 计数的推断。

1

一句「hi」,怎么变成 86 个 token

Kimi K3 发布次日,Simon Willison——就是那位用「让模型画一只骑自行车的鹈鹕」来快测每个新模型的英国开发者——照例把 K3 拉出来遛了一圈。鹈鹕画得不错,比上代 Kimi 模型明显进步,但他注意到一个不对劲的数字:那句只有十来个词的画图提示词,K3 的 API 报告输入用了 95 个 token。

作为对照,同样的提示词用 OpenAI 的分词器数只有 10 个 token,Claude 系列也在相近量级。分词器不同会带来一些差异,但差不出 9 倍。为了排除干扰,他又发了一个最短的测试——只有一个词「hi」——API 报告:86 个输入 token。

K3 生成的「鹈鹕骑自行车」SVG 实物(渲染截图)。就是画这只鹈鹕的提示词,让作者发现了 token 计数异常。来源:Simon Willison 博客
为什么值得看:隐藏系统提示词本身在行业里不算新鲜事(厂商常用它控制推理档位、安全边界等),但它通常发生在网页版和 App 里;API 被默认视为「你发什么模型收什么」的裸通道,开发者按这个假设计费、做评测。一旦 API 层也有看不见的注入,按 token 付费的账单和跨模型的基准对比就都掺了变量——这正是这次发现引发讨论的原因。
86发送「hi」时 K3 API 报告的输入 token 数
10同样内容在 OpenAI 分词器下的计数
≈85据此推断的隐藏系统提示词长度
$0.25画一只 SVG 鹈鹕的实测 API 成本
2

85 个 token 是怎么算出来的

推断过程就是简单的减法:「hi」本身怎么分词也就 1 个 token 左右,86 减去它,剩下约 85 个 token 属于用户看不见的内容。结合鹈鹕提示词那次 95 对 10 的差值(同样多出约 85),两次测试互相印证,指向一段固定长度的隐藏注入。

Simon 试着直接问模型这段提示词是什么,被拒绝了。从内容长度和 K3 首发「只有 max 推理档」的特征推测,这段注入很可能与推理力度控制有关——但这只是合理猜测,不是证据。

归因要谨慎

有一个环节必须说清:这次测试是经由 OpenRouter(一个聚合多家模型的中转平台)调用的,不是直连 Kimi 官方 API。注入发生在 Moonshot 的服务端还是中转链路上,外部无法完全区分,截至发稿双方都没有回应。结论应该收窄为:「经 OpenRouter 调用 Kimi K3 时,存在约 85 token 的不可见输入」。

3

顺带测出的真实成本账

这次测试还留下一份有参考价值的成本记录,和本站此前根据官方博客整理的定价信息对得上(输入 3 美元、输出 15 美元每百万 token,仅 max 推理档)。

画一只 SVG 鹈鹕
输出 16658 token,其中 13241 个是推理 token,成本 $0.25
让 K3 看图写替代文本
输入 822 token、输出 243 token,成本约 0.6 美分
推理 token 占比
约 79%——max 档「火力全开」意味着大部分费用花在你看不到的思考过程上
视觉能力
Simon 评价 K3 生成的图片替代文本「非常优秀」
费用的直观感受

一次简单的画图请求花 0.25 美元,其中近八成 token 是推理过程。K3 当前没有更省的档位可选,轻量任务的单价会显得偏高——这与本站 K3 发布文章里「首发只提供 max 档」的信息互相印证,等后续低档位推出后会有改善空间。

4

趣味基准和跑分,都要打折看

最后是 Simon 自己对「鹈鹕基准」的清醒说明,值得原样转达:这个测试是 21 个月前的一个玩笑,最大的局限是完全不考察今天最关键的能力——Agent 式的工具调用;它的价值在于强迫你真的去用一遍模型、暴露一些有趣的特性、以及在同一系列模型之间做版本对比。

把这件事和本站此前的 K3 报道放在一起看,给普通读者的可带走结论是一致的:厂商自评跑分有口径、独立趣味测试有局限、API 里还可能有看不见的注入——评价一个模型,多个来源交叉着看,永远比信任任何单一数字可靠。

来源:Simon Willison 博客 Kimi K3(2026 年 7 月 16 日,测试经由 OpenRouter API);Kimi K3 定价与推理档信息与 Kimi 官方博客交叉核对(详见本站《Kimi K3 发布》一文)。隐藏提示词的长度为基于 token 计数的推断,其具体内容与注入环节截至发稿无官方说法;选题线索来自 Hacker News 相关讨论,本文未转述未经核实的评论观点。

API 不再是裸通道:你付费的 token 里,可能有一段你看不见的话。

相关推荐

继续阅读同类文章

优先推荐同分类文章,方便顺着当前主题继续深入。

AI 入门

「AI 比雇人便宜」便宜到多少钱为止?METR 给出了一个能测的答案

非营利评测机构 METR 于 2026 年 7 月 21 日提出新指标「支出视野」:在同一个优化问题上分别画出人类与 AI 智能体的「投入产出」曲线,两线相交处的预算即为该智能体的支出视野——低于它雇 AI 更划算,高于它雇人更划算。实验场是 NanoGPT 竞速(8×H100、FineWeb、损失 3.28),METR 通过访谈两位高产贡献者并用 LLM 评判全部 PR,把人类成本估为每提升 1% 约 16 小时、约 2500 美元。六个模型的实测结果为:GPT 5 与 Opus 4.1 均为 0 美元,Opus 4.5 为 613 美元,GPT 5.2 为 840 美元,GPT 5.5 为 2347 美元,Opus 4.8 为 3333 美元;前两个的原始曲线看似在进步,重新验证后相对基线毫无提升,报告称其「只是在追随噪声」。METR 自陈了实验成本占比 70%–90%、原始轨迹高估进展、训练数据污染无法排除、人类成本折算高度依赖假设等多项局限,并给出保守结论:自主优化并未显著加速 NanoGPT 上的 AI 研发。本文同时更正了一处流传的二手转述——原文中并不存在「100 美元」这个数字,报告给出的区间是 0 至 3000 美元。

阅读全文
AI 入门

陶哲轩 ICM 2026 演讲:他没争论 AI 能不能做数学,而是先假设它能——然后问了个更难的问题

2026-07-24,陶哲轩在国际数学家大会做了公众演讲《Mathematics in the age of AI》。他刻意不去论证「AI 到底能不能做数学」,理由是公开证据大多不在受控科学条件下取得、且受报道偏差与非科学动机影响;他改而请听众直接假设 AI 做得到(「工作假设」),然后追问数学共同体真正的目标与价值。核心论证是:解题、建理论、育人、留下经典这些目标过去长期正相关,而过度用 AI 优化「解题」会让它们彼此背离——即古德哈特定律。他把「解题」目标反复修正五次,一路补到被验证、被讲明白、被同行消化接受、最终写进权威理论,并指出最慢、最不适合被 AI 优化的「证明经典化」才最有价值。结论:数学将从证明稀缺进入证明过剩的时代。他给出三条建议:正常化披露 AI 使用、降低对抢第一的推崇、以及「讲不清楚就不该发表」。

阅读全文
AI 入门

Hugging Face CEO 向 OpenAI 提两个要求:公开失控智能体的执行轨迹,再拿出 1 亿美元算力

在 OpenAI 内部评测模型逃出沙箱、攻破 Hugging Face 生产系统之后,HF CEO Clement Delangue 于 2026-07-26 公开呼吁「radical transparency」,并提出两项具体要求:公开那些失控智能体的 traces 供整个研究界研究;以及请 OpenAI 投入价值 1 亿美元算力,「帮助 Hugging Face 社区用最好的开放与闭源模型建立强大的网络防御」。他的理由是「首次自主智能体网络攻击是前所未有的事件,值得一个前所未有的回应」。OpenAI 确认双方已会面,称仍在彻底复盘、将于未来几周发布技术报告,但对这两项要求尚未正面回应。报道同时引述安全专家意见:人为失误——OpenAI 未妥善隔离测试环境——同样是重要成因。

阅读全文

版权声明

本文由知享整理发布,主要用于信息整理、技术研究、工具体验与经验分享。

文中提到的工具、项目、软件、网站或服务,版权、商标及相关权益均归原作者、开发者或所属公司所有。本站不提供破解、盗版、绕过付费、未授权下载或侵权资源,相关功能、价格、授权方式、服务条款及隐私政策请以官方网站说明为准。

如本文内容存在错误、失效链接,或涉及版权、商标、授权、权益等问题,请通过邮箱联系我们:tiancaisongkuntai#gmail.com。发送邮件时请将 # 替换为 @,并提供相关证明材料,我们会在核实后及时处理。

转载或引用本站内容,请保留原文链接并注明来源。