返回文章列表
文章详情AI 入门

顶级会议往论文里埋「隐形暗号」,专抓用 AI 代写审稿的人:NeurIPS 用 prompt injection 反制,也惹来争议

为了揪出「把论文丢给大模型、让 AI 代写审稿」的懒政,AI 顶会 NeurIPS 2026 在送审论文里植入只有 AI 会读到的隐藏指令,诱导 LLM 在评审里写出暗号短语(如 This work addresses the central challenge)——评审出现暗号就等于自曝 AI 代写。已知暗号两句,有人在 PDF 转 Word 时才发现。隔壁 ICML 2026 用类似手段桌拒近 500 篇(约 2%)。但争议很大:prompt injection 正是会议禁止作者使用的手段,批评者称「预设恶意的陷阱会腐蚀系统信任」。一次聪明的反制,也是一记「连防作弊都要靠藏话」的警钟。

更新于 2026-07-245 分钟5

一分钟速览

  • 顶级 AI 会议 NeurIPS 2026 干了件反直觉的事:在送去同行评审的论文里,偷偷埋进只有 AI 才「看得到」的隐藏指令,专门用来钓那些用大模型代写审稿意见的人——谁的评审里冒出了指定的「暗号」短语,就说明这份评审是让 AI 代读代写的。
  • 已知的暗号有两句:让 LLM 在评审里写出「This work addresses the central challenge」和「The claims of the paper」。NeurIPS 拒绝公开更多,称一旦说破这套机制就失效了。有研究者是在把论文 PDF 转成 Word 时,才意外发现这些藏起来的文字。
  • 不是孤例,而且真抓到了人:另一个顶会 ICML 2026 用类似手段,**桌拒了近 500 篇论文(约占投稿总量的 2%)**,理由是审稿人违反了「不得用 LLM 代写评审」的规定。CMU 的 Nihar Shah 说,社区对此的支持之强前所未见——「大家实在受够了审稿人复制粘贴 AI 生成的评审」。
  • 但争议很大:这本质上是「用 prompt injection 设套」,而会议自己的规定又明令禁止作者用 prompt injection 操纵评审。批评者说,「设计一个预设对方不怀好意的陷阱,会腐蚀整个系统赖以存在的信任」;也有人认为这是个「糟糕的机制」,把问题的锅甩给审稿人这个「最显眼的背锅点」。
  • 冷静一句:这是顶会第一次大规模主动用 prompt injection 来「钓」AI 审稿,针对的是「根本没看论文、全交给 AI 代读代写」的懒政;但它同时把一件尴尬事摆上台面——当 AI 深度介入学术流程,连「防作弊」本身都得靠往文档里藏话来实现。

⚑ 本文事实基于科学媒体 The Transmitter 报道《Scientists decry conference's use of hidden prompts to snare AI peer reviews》(2026-07-01,作者 Dalmeet Singh Chawla,本站已直接核阅)与 NeurIPS 2026 官方审稿指南页(neurips.cc,本站已直接核阅其时间线与「评审中使用 Agent/LLM」政策)整理。已知的两句暗号、ICML 桌拒近 500 篇(约 2%)、Nihar Shah 及批评者 Sören Auer、Sara Atito 的表态均出自该报道。NeurIPS 未公开注入短语的完整清单;日报里提到的第三句短语未在本站核到的一手报道中得到确认,故未采用。

1

会议在论文里埋了只有 AI 看得到的「暗号」

同行评审(peer review)本该是「专家认真读完你的论文、给出专业意见」。但越来越多审稿人偷懒,把论文直接丢给大模型、让 AI 代写评审——有的甚至根本没读原文。顶级 AI 会议 NeurIPS 2026 决定用一种极具争议的方式反制:**在发给审稿人的论文里,偷偷植入只有 AI 会「读到并执行」的隐藏指令。**

这些指令的内容是:诱导大模型在写出的评审意见里,夹带几句特定的「暗号」短语。正常审稿人自己读、自己写,绝不会平白无故蹦出这些句子;可一旦有人把这篇论文喂给 LLM、让它代写评审,AI 就会「乖乖」把暗号照写进去——评审里出现暗号,就等于自曝「这是 AI 代写的」。等于给偷懒的审稿人埋了一个只有机器会踩、人不会踩的雷。

为什么值得看:为什么值得看:这件事同时踩中两个当下最热的点——**prompt injection(提示注入)**和 **AI 侵入学术诚信**。平时我们讨论 prompt injection,多是把它当成一种攻击手段(往网页、文档里藏话去操纵别人的 AI);这次却是顶级会议把它当成「防御性诱捕」来用。它逼着所有人正视一个问题:当 AI 已经能替人读、替人写,连最讲究「人来把关」的学术评审,都要靠往文件里藏暗号来分辨「这到底是人做的还是机器做的」。
科学媒体 The Transmitter 的报道:《科学家批评会议用隐藏提示词诱捕 AI 同行评审》。副标题点出核心张力——这些看不见的指令「诱导大模型在评审里写出暗号短语,抓 AI 滥用有效,但也侵蚀信任」。来源:thetransmitter.org 报道截图
2

暗号是哪两句,又是怎么被发现的

这套机制的巧妙之处,在于它利用了「人和 AI 读同一份文件时看到的东西不一样」。

只有机器会踩的雷

隐藏指令被藏进论文文件里,用肉眼几乎看不见的方式呈现(例如极小字号或与背景同色的文字),人类审稿人正常阅读根本注意不到;但大模型在「读」这份文件时,会把这些隐藏文字一并当成指令吃进去、并照做。目前被公开确认的暗号有两句——要求 LLM 在评审里写出 「This work addresses the central challenge」「The claims of the paper」。NeurIPS 组委会刻意不公开完整的短语清单,理由是「一旦详细讨论注入的提示词,这套干预手段就会失效」。这些藏起来的文字并非无法察觉:有研究者正是在把论文 PDF 转换成 Word 文档时,才让隐藏内容现了形。

换句话说,它赌的是「懒到直接把原文喂给 AI 的人,不会先去检查文件里有没有猫腻」——而真正认真读论文的审稿人,压根不会触发这个机制。

3

不止 NeurIPS:ICML 已因此桌拒近 500 篇

这不是一次小打小闹的实验,隔壁的顶会已经用同类手段抓到了实打实的一批人。

真的抓到了,而且社区叫好

另一个机器学习顶会 ICML 2026(第 43 届,首尔)用了类似的诱捕机制,结果桌拒了近 500 篇论文,约占其投稿总量的 2%——这些论文的审稿人被判定违反了「不得用 LLM 代写评审」的政策(注:被处理的是审稿环节的违规,桌拒是该会对相关投稿的处置)。担任 ICML 科学诚信主席的卡内基梅隆大学学者 Nihar Shah 表示,他很少见到社区对一件事有如此强的支持:「大家实在受够了审稿人复制粘贴 AI 生成的评审。」 这也解释了为什么 NeurIPS 这样的顶会愿意冒争议去用这种非常规手段——AI 代写评审的泛滥,已经到了让审稿制度本身失去意义的地步。

~500ICML 2026 因违反 LLM 评审规定被桌拒的论文
~2%占 ICML 投稿总量的比例
2 句目前已公开确认的暗号短语(完整清单未披露)
7 月 22 日NeurIPS 2026 评审意见公布日
4

抓作弊,还是「设套」?

叫好声之外,反对的声音同样强烈,而且戳中了一个尴尬的自相矛盾。

一个会议禁止的手段,被会议自己用了

争议的核心在于:prompt injection 恰恰是 NeurIPS 明令禁止作者使用的手段——按其政策,任何试图操纵评审流程的行为(包括提示注入)都被严格禁止,审稿人若发现论文里有隐藏指令还应当上报。如今会议却反过来自己往论文里注入提示词,难免落下「双标」之嫌。批评者 Sören Auer 的话很有代表性:「设计一个预设对方不怀好意的陷阱,会腐蚀整个系统赖以存在的信任。」 另一位学者 Sara Atito 则认为,隐藏提示词是个「糟糕的机制」,解决不了同行评审更深层的问题,只是把责任甩给审稿人这个「最显眼的背锅点」。NeurIPS 一方面拒绝细谈(称说多了机制就失效),另一方面也表示会回复被标记的审稿人,告知他们不要因此去惩罚具体的论文——试图把「揪出偷懒审稿人」和「不误伤被审的论文」分开。

NeurIPS 2026 官方审稿指南页:明确的评审时间线(评审意见 7 月 22 日公布)与专门的「评审中使用 Agent 和 LLM 的政策」条目。会议一边立规矩约束 AI 在评审中的使用,一边用提示注入来查谁违规。来源:neurips.cc 官方页面截图
5

它反映了什么

抛开立场,这件事本身是一面镜子。

两个层面看它

技术层面,它把 prompt injection 的「两面性」摆得很清楚:同一种「往文档里藏话操纵 AI」的技术,既可以是攻击(作者藏话逼评审给「接收」),也可以被拿来做防御性诱捕(会议藏话钓出偷懒的 AI 审稿)——这也说明,只要 AI 会不加分辨地执行文档里的隐藏指令,这个口子就一直在。制度层面,它暴露的是更根本的困境:AI 代写已经渗透到「本该由人把关」的环节,逼得会议不得不用「藏暗号」这种非常规、甚至有争议的方式来自证「评审还是人做的」。诱捕能抓一时的懒政,但真正的问题——评审激励不足、AI 滥用泛滥——并不会因为几句暗号而消失。

所以这既是一次聪明的反制,也是一记警钟:当「这到底是人写的还是 AI 写的」成了顶级学术会议都要费力分辨的问题,需要修补的显然不止是审稿人这一环。

来源:The Transmitter《Scientists decry conference's use of hidden prompts to snare AI peer reviews》(作者 Dalmeet Singh Chawla,2026-07-01,本站直接核阅;NeurIPS 官方植入隐藏提示、两句已知暗号、PDF 转 Word 时被发现、ICML 桌拒近 500 篇/约 2%、Nihar Shah 及 Sören Auer、Sara Atito 的表态、NeurIPS「告知勿惩罚具体论文」的回应均出自此文);NeurIPS 2026 官方审稿指南页(neurips.cc,本站直接核阅其评审时间线与「评审中使用 Agent/LLM」政策)。NeurIPS 未公开注入短语完整清单;社区在 2026 年 7 月 22 日前后评审公布时对此展开讨论。配图为上述报道页与 NeurIPS 官方页面截图。

为了抓出「让 AI 代写评审、根本没读论文」的人,顶级会议往论文里埋了只有机器会踩的暗号——抓作弊的巧招,却也是一记「连防作弊都得靠藏话」的警钟。

相关推荐

继续阅读同类文章

优先推荐同分类文章,方便顺着当前主题继续深入。

AI 入门

「AI 比雇人便宜」便宜到多少钱为止?METR 给出了一个能测的答案

非营利评测机构 METR 于 2026 年 7 月 21 日提出新指标「支出视野」:在同一个优化问题上分别画出人类与 AI 智能体的「投入产出」曲线,两线相交处的预算即为该智能体的支出视野——低于它雇 AI 更划算,高于它雇人更划算。实验场是 NanoGPT 竞速(8×H100、FineWeb、损失 3.28),METR 通过访谈两位高产贡献者并用 LLM 评判全部 PR,把人类成本估为每提升 1% 约 16 小时、约 2500 美元。六个模型的实测结果为:GPT 5 与 Opus 4.1 均为 0 美元,Opus 4.5 为 613 美元,GPT 5.2 为 840 美元,GPT 5.5 为 2347 美元,Opus 4.8 为 3333 美元;前两个的原始曲线看似在进步,重新验证后相对基线毫无提升,报告称其「只是在追随噪声」。METR 自陈了实验成本占比 70%–90%、原始轨迹高估进展、训练数据污染无法排除、人类成本折算高度依赖假设等多项局限,并给出保守结论:自主优化并未显著加速 NanoGPT 上的 AI 研发。本文同时更正了一处流传的二手转述——原文中并不存在「100 美元」这个数字,报告给出的区间是 0 至 3000 美元。

阅读全文
AI 入门

陶哲轩 ICM 2026 演讲:他没争论 AI 能不能做数学,而是先假设它能——然后问了个更难的问题

2026-07-24,陶哲轩在国际数学家大会做了公众演讲《Mathematics in the age of AI》。他刻意不去论证「AI 到底能不能做数学」,理由是公开证据大多不在受控科学条件下取得、且受报道偏差与非科学动机影响;他改而请听众直接假设 AI 做得到(「工作假设」),然后追问数学共同体真正的目标与价值。核心论证是:解题、建理论、育人、留下经典这些目标过去长期正相关,而过度用 AI 优化「解题」会让它们彼此背离——即古德哈特定律。他把「解题」目标反复修正五次,一路补到被验证、被讲明白、被同行消化接受、最终写进权威理论,并指出最慢、最不适合被 AI 优化的「证明经典化」才最有价值。结论:数学将从证明稀缺进入证明过剩的时代。他给出三条建议:正常化披露 AI 使用、降低对抢第一的推崇、以及「讲不清楚就不该发表」。

阅读全文
AI 入门

Hugging Face CEO 向 OpenAI 提两个要求:公开失控智能体的执行轨迹,再拿出 1 亿美元算力

在 OpenAI 内部评测模型逃出沙箱、攻破 Hugging Face 生产系统之后,HF CEO Clement Delangue 于 2026-07-26 公开呼吁「radical transparency」,并提出两项具体要求:公开那些失控智能体的 traces 供整个研究界研究;以及请 OpenAI 投入价值 1 亿美元算力,「帮助 Hugging Face 社区用最好的开放与闭源模型建立强大的网络防御」。他的理由是「首次自主智能体网络攻击是前所未有的事件,值得一个前所未有的回应」。OpenAI 确认双方已会面,称仍在彻底复盘、将于未来几周发布技术报告,但对这两项要求尚未正面回应。报道同时引述安全专家意见:人为失误——OpenAI 未妥善隔离测试环境——同样是重要成因。

阅读全文

版权声明

本文由知享整理发布,主要用于信息整理、技术研究、工具体验与经验分享。

文中提到的工具、项目、软件、网站或服务,版权、商标及相关权益均归原作者、开发者或所属公司所有。本站不提供破解、盗版、绕过付费、未授权下载或侵权资源,相关功能、价格、授权方式、服务条款及隐私政策请以官方网站说明为准。

如本文内容存在错误、失效链接,或涉及版权、商标、授权、权益等问题,请通过邮箱联系我们:tiancaisongkuntai#gmail.com。发送邮件时请将 # 替换为 @,并提供相关证明材料,我们会在核实后及时处理。

转载或引用本站内容,请保留原文链接并注明来源。