返回文章列表
文章详情AI 入门

顶级会议往论文里埋「隐形暗号」,专抓用 AI 代写审稿的人:NeurIPS 用 prompt injection 反制,也惹来争议

为了揪出「把论文丢给大模型、让 AI 代写审稿」的懒政,AI 顶会 NeurIPS 2026 在送审论文里植入只有 AI 会读到的隐藏指令,诱导 LLM 在评审里写出暗号短语(如 This work addresses the central challenge)——评审出现暗号就等于自曝 AI 代写。已知暗号两句,有人在 PDF 转 Word 时才发现。隔壁 ICML 2026 用类似手段桌拒近 500 篇(约 2%)。但争议很大:prompt injection 正是会议禁止作者使用的手段,批评者称「预设恶意的陷阱会腐蚀系统信任」。一次聪明的反制,也是一记「连防作弊都要靠藏话」的警钟。

更新于 2026-07-245 分钟5

一分钟速览

  • 顶级 AI 会议 NeurIPS 2026 干了件反直觉的事:在送去同行评审的论文里,偷偷埋进只有 AI 才「看得到」的隐藏指令,专门用来钓那些用大模型代写审稿意见的人——谁的评审里冒出了指定的「暗号」短语,就说明这份评审是让 AI 代读代写的。
  • 已知的暗号有两句:让 LLM 在评审里写出「This work addresses the central challenge」和「The claims of the paper」。NeurIPS 拒绝公开更多,称一旦说破这套机制就失效了。有研究者是在把论文 PDF 转成 Word 时,才意外发现这些藏起来的文字。
  • 不是孤例,而且真抓到了人:另一个顶会 ICML 2026 用类似手段,**桌拒了近 500 篇论文(约占投稿总量的 2%)**,理由是审稿人违反了「不得用 LLM 代写评审」的规定。CMU 的 Nihar Shah 说,社区对此的支持之强前所未见——「大家实在受够了审稿人复制粘贴 AI 生成的评审」。
  • 但争议很大:这本质上是「用 prompt injection 设套」,而会议自己的规定又明令禁止作者用 prompt injection 操纵评审。批评者说,「设计一个预设对方不怀好意的陷阱,会腐蚀整个系统赖以存在的信任」;也有人认为这是个「糟糕的机制」,把问题的锅甩给审稿人这个「最显眼的背锅点」。
  • 冷静一句:这是顶会第一次大规模主动用 prompt injection 来「钓」AI 审稿,针对的是「根本没看论文、全交给 AI 代读代写」的懒政;但它同时把一件尴尬事摆上台面——当 AI 深度介入学术流程,连「防作弊」本身都得靠往文档里藏话来实现。

⚑ 本文事实基于科学媒体 The Transmitter 报道《Scientists decry conference's use of hidden prompts to snare AI peer reviews》(2026-07-01,作者 Dalmeet Singh Chawla,本站已直接核阅)与 NeurIPS 2026 官方审稿指南页(neurips.cc,本站已直接核阅其时间线与「评审中使用 Agent/LLM」政策)整理。已知的两句暗号、ICML 桌拒近 500 篇(约 2%)、Nihar Shah 及批评者 Sören Auer、Sara Atito 的表态均出自该报道。NeurIPS 未公开注入短语的完整清单;日报里提到的第三句短语未在本站核到的一手报道中得到确认,故未采用。

1

会议在论文里埋了只有 AI 看得到的「暗号」

同行评审(peer review)本该是「专家认真读完你的论文、给出专业意见」。但越来越多审稿人偷懒,把论文直接丢给大模型、让 AI 代写评审——有的甚至根本没读原文。顶级 AI 会议 NeurIPS 2026 决定用一种极具争议的方式反制:**在发给审稿人的论文里,偷偷植入只有 AI 会「读到并执行」的隐藏指令。**

这些指令的内容是:诱导大模型在写出的评审意见里,夹带几句特定的「暗号」短语。正常审稿人自己读、自己写,绝不会平白无故蹦出这些句子;可一旦有人把这篇论文喂给 LLM、让它代写评审,AI 就会「乖乖」把暗号照写进去——评审里出现暗号,就等于自曝「这是 AI 代写的」。等于给偷懒的审稿人埋了一个只有机器会踩、人不会踩的雷。

为什么值得看:为什么值得看:这件事同时踩中两个当下最热的点——**prompt injection(提示注入)**和 **AI 侵入学术诚信**。平时我们讨论 prompt injection,多是把它当成一种攻击手段(往网页、文档里藏话去操纵别人的 AI);这次却是顶级会议把它当成「防御性诱捕」来用。它逼着所有人正视一个问题:当 AI 已经能替人读、替人写,连最讲究「人来把关」的学术评审,都要靠往文件里藏暗号来分辨「这到底是人做的还是机器做的」。
科学媒体 The Transmitter 的报道:《科学家批评会议用隐藏提示词诱捕 AI 同行评审》。副标题点出核心张力——这些看不见的指令「诱导大模型在评审里写出暗号短语,抓 AI 滥用有效,但也侵蚀信任」。来源:thetransmitter.org 报道截图
2

暗号是哪两句,又是怎么被发现的

这套机制的巧妙之处,在于它利用了「人和 AI 读同一份文件时看到的东西不一样」。

只有机器会踩的雷

隐藏指令被藏进论文文件里,用肉眼几乎看不见的方式呈现(例如极小字号或与背景同色的文字),人类审稿人正常阅读根本注意不到;但大模型在「读」这份文件时,会把这些隐藏文字一并当成指令吃进去、并照做。目前被公开确认的暗号有两句——要求 LLM 在评审里写出 「This work addresses the central challenge」「The claims of the paper」。NeurIPS 组委会刻意不公开完整的短语清单,理由是「一旦详细讨论注入的提示词,这套干预手段就会失效」。这些藏起来的文字并非无法察觉:有研究者正是在把论文 PDF 转换成 Word 文档时,才让隐藏内容现了形。

换句话说,它赌的是「懒到直接把原文喂给 AI 的人,不会先去检查文件里有没有猫腻」——而真正认真读论文的审稿人,压根不会触发这个机制。

3

不止 NeurIPS:ICML 已因此桌拒近 500 篇

这不是一次小打小闹的实验,隔壁的顶会已经用同类手段抓到了实打实的一批人。

真的抓到了,而且社区叫好

另一个机器学习顶会 ICML 2026(第 43 届,首尔)用了类似的诱捕机制,结果桌拒了近 500 篇论文,约占其投稿总量的 2%——这些论文的审稿人被判定违反了「不得用 LLM 代写评审」的政策(注:被处理的是审稿环节的违规,桌拒是该会对相关投稿的处置)。担任 ICML 科学诚信主席的卡内基梅隆大学学者 Nihar Shah 表示,他很少见到社区对一件事有如此强的支持:「大家实在受够了审稿人复制粘贴 AI 生成的评审。」 这也解释了为什么 NeurIPS 这样的顶会愿意冒争议去用这种非常规手段——AI 代写评审的泛滥,已经到了让审稿制度本身失去意义的地步。

~500ICML 2026 因违反 LLM 评审规定被桌拒的论文
~2%占 ICML 投稿总量的比例
2 句目前已公开确认的暗号短语(完整清单未披露)
7 月 22 日NeurIPS 2026 评审意见公布日
4

抓作弊,还是「设套」?

叫好声之外,反对的声音同样强烈,而且戳中了一个尴尬的自相矛盾。

一个会议禁止的手段,被会议自己用了

争议的核心在于:prompt injection 恰恰是 NeurIPS 明令禁止作者使用的手段——按其政策,任何试图操纵评审流程的行为(包括提示注入)都被严格禁止,审稿人若发现论文里有隐藏指令还应当上报。如今会议却反过来自己往论文里注入提示词,难免落下「双标」之嫌。批评者 Sören Auer 的话很有代表性:「设计一个预设对方不怀好意的陷阱,会腐蚀整个系统赖以存在的信任。」 另一位学者 Sara Atito 则认为,隐藏提示词是个「糟糕的机制」,解决不了同行评审更深层的问题,只是把责任甩给审稿人这个「最显眼的背锅点」。NeurIPS 一方面拒绝细谈(称说多了机制就失效),另一方面也表示会回复被标记的审稿人,告知他们不要因此去惩罚具体的论文——试图把「揪出偷懒审稿人」和「不误伤被审的论文」分开。

NeurIPS 2026 官方审稿指南页:明确的评审时间线(评审意见 7 月 22 日公布)与专门的「评审中使用 Agent 和 LLM 的政策」条目。会议一边立规矩约束 AI 在评审中的使用,一边用提示注入来查谁违规。来源:neurips.cc 官方页面截图
5

它反映了什么

抛开立场,这件事本身是一面镜子。

两个层面看它

技术层面,它把 prompt injection 的「两面性」摆得很清楚:同一种「往文档里藏话操纵 AI」的技术,既可以是攻击(作者藏话逼评审给「接收」),也可以被拿来做防御性诱捕(会议藏话钓出偷懒的 AI 审稿)——这也说明,只要 AI 会不加分辨地执行文档里的隐藏指令,这个口子就一直在。制度层面,它暴露的是更根本的困境:AI 代写已经渗透到「本该由人把关」的环节,逼得会议不得不用「藏暗号」这种非常规、甚至有争议的方式来自证「评审还是人做的」。诱捕能抓一时的懒政,但真正的问题——评审激励不足、AI 滥用泛滥——并不会因为几句暗号而消失。

所以这既是一次聪明的反制,也是一记警钟:当「这到底是人写的还是 AI 写的」成了顶级学术会议都要费力分辨的问题,需要修补的显然不止是审稿人这一环。

来源:The Transmitter《Scientists decry conference's use of hidden prompts to snare AI peer reviews》(作者 Dalmeet Singh Chawla,2026-07-01,本站直接核阅;NeurIPS 官方植入隐藏提示、两句已知暗号、PDF 转 Word 时被发现、ICML 桌拒近 500 篇/约 2%、Nihar Shah 及 Sören Auer、Sara Atito 的表态、NeurIPS「告知勿惩罚具体论文」的回应均出自此文);NeurIPS 2026 官方审稿指南页(neurips.cc,本站直接核阅其评审时间线与「评审中使用 Agent/LLM」政策)。NeurIPS 未公开注入短语完整清单;社区在 2026 年 7 月 22 日前后评审公布时对此展开讨论。配图为上述报道页与 NeurIPS 官方页面截图。

为了抓出「让 AI 代写评审、根本没读论文」的人,顶级会议往论文里埋了只有机器会踩的暗号——抓作弊的巧招,却也是一记「连防作弊都得靠藏话」的警钟。

相关推荐

继续阅读同类文章

优先推荐同分类文章,方便顺着当前主题继续深入。

AI 入门

AI 会「读图」却不会「看图」:新基准 ActiveVision 上最强模型只得 10.6%,人类 96.1%

南加州大学的新基准 ActiveVision(论文《An Exam for Active Observers》)专门测「主动视觉观察」——数乱线里的闭环、跟箭头链走到终点、找完全相同的剪影等必须反复回看的题。结果前沿多模态模型全面崩溃:最强的 GPT-5.5 只得 10.6%(17 任务里 11 个 0 分),Claude Fable 5 仅 3.5%,而三名人类平均 96.1%、每题约 30 秒。让 Claude Code+Fable 5 自己写代码当工具智能体也只到 50.6%、每题要 12–15 分钟。原因:人看图是「猜测→回看验证」的闭环,模型却是「看一眼就描述」。会认图不等于能可靠读工程图、电路图。

阅读全文
AI 入门

所有 AI 画「骑车鹈鹕」都朝右,是在给出名基准刷分吗?1008 张 SVG 的实测:证据不足

Simon Willison 多年用「画一只骑自行车的鹈鹕」测试每个新模型,这个玩笑基准太出名,于是有人怀疑各家在偷偷针对它刷分(pelicanmaxxing)。研究者 Dylan Castillo 用 8 动物×6 载具×7 模型共 1008 张 SVG 实测:鹈鹕画质排第 6、自行车倒数第二、组合排第 42,难度校正后无显著专项加成——几乎没有刷分证据。至于「全都朝右」?真的,但不特殊:全体 60%、自行车 81% 都朝右,只是侧面比正面好画。作者也诚实列了单一评委、80 美元预算等局限,故口径是「证据不足」而非定论。

阅读全文
AI 入门

Bento:把整个「PPT 软件」塞进一个 HTML 文件——560 KB、免安装、文件即软件

Bento 是一个幻灯片工具,但查看器、播放器、编辑器全打包进一个约 560 KB 的 HTML 文件里:发给别人,浏览器打开就能看能编能放映,不用装、不用注册。数据是文件顶部一段明文 JSON,人能读、AI(Claude Code/Cursor/本地模型)能直接改;保存时文件重写自己。本地优先,可选端到端加密协作。MIT 开源、GitHub 590+ 星。冷静提醒:这是刚创建一周的新项目、作者为新账号无维护历史,概念惊艳但宜按早期项目对待。

阅读全文

版权声明

本文由知享整理发布,主要用于信息整理、技术研究、工具体验与经验分享。

文中提到的工具、项目、软件、网站或服务,版权、商标及相关权益均归原作者、开发者或所属公司所有。本站不提供破解、盗版、绕过付费、未授权下载或侵权资源,相关功能、价格、授权方式、服务条款及隐私政策请以官方网站说明为准。

如本文内容存在错误、失效链接,或涉及版权、商标、授权、权益等问题,请通过邮箱联系我们:tiancaisongkuntai#gmail.com。发送邮件时请将 # 替换为 @,并提供相关证明材料,我们会在核实后及时处理。

转载或引用本站内容,请保留原文链接并注明来源。