一分钟速览
- 一个新基准 ActiveVision(美国南加州大学团队,论文《An Exam for Active Observers》)专门测「主动视觉观察」——那种要一边看一边推理、反复把目光移来移去才能完成的视觉任务,比如数清一团乱线里有几个闭环、顺着箭头链走到终点、找出和模板一模一样的剪影。
- 结果前沿多模态大模型「全面崩溃」:目前最强的 GPT-5.5(最高推理档)只做对 **10.6%**(85 题里 9 题),17 个任务里有 **11 个直接 0 分**;连屠榜的 Claude Fable 5 也只有 3.5%。而三名人类平均 **96.1%**,每题大约 30 秒就搞定。
- 给 AI「开挂」也提升有限:让 Claude Code + Fable 5 当工具智能体、自己写代码调用视觉库来做,成绩升到 **50.6%**,但仍远低于人类,且每题要花 12–15 分钟。论文指出,模型自写的视觉代码在真实照片上并不可靠,而「发现代码出错」本身,恰恰又需要它缺的那种主动观察。
- 为什么差这么多:人看图是一个「闭环」——先有个猜测,再把视线移过去验证、修正,如此往复。而今天的多模态模型更像「看一眼就描述」,缺少这种「边看边想、反复回看」的能力。
- 冷静一句:这不是说 AI「看不见」,而是说它在「需要一步步主动查看」的视觉任务上还很弱。它也提醒我们:模型在演示里认图很惊艳,不等于能可靠地读工程图纸、电路图这类需要反复核对的图。
⚑ 本文基于论文《An Exam for Active Observers》(arXiv:2607.16165,作者 Jiarui Zhang、Muzi Tao、Shangshang Wang、Ollie Liu、Xuezhe Ma、Willie Neiswanger,美国南加州大学 USC)及其项目站 activevision.dev 整理(本站已直接核阅论文摘要与项目站)。分数、任务数、任务类别、人类用时等均出自论文与项目站。日报里「Fable 5 用工具达 50%」,经查原文为「Claude Code + Fable 5 工具智能体得 50.6%、仍远低于人类」,本文按原文更正并补全语境。
AI 能给整幅画写小作文,却数不清一团乱线里有几个圈
这两年多模态大模型给人的印象是「看图很强」:发一张照片,它能认出物体、读出文字、还能写一大段描述。但南加州大学的一组研究者做了个新测试,专门戳它的一个软肋,结果相当扎眼——**在一类人类小孩都能做的视觉题上,最强的模型几乎全军覆没。**
他们把这个基准叫 ActiveVision,考的是「主动视觉观察」:不是看一眼就答,而是要你一边看一边想、把目光反复移来移去才能做对。比如给你一团缠在一起的曲线,问「这里有几个互相分开的闭环?」;或者给你一串带箭头的链条,让你「从标记的箭头出发一路跟下去,报出终点的字母」。这些题人类扫一眼、再顺着描两下就答出来了,模型却频频翻车。

它到底考什么:三类「必须反复看」的任务
ActiveVision 一共 17 个任务、85 道题,分成三大类,每一类都刻意设计成「看一眼答不出、必须主动来回查」。
① 分布式扫描(Distributed Scanning):需要把画面里许多分散的局部信号一个不漏地看全。典型题「乱线数闭环」——在一堆缠绕的曲线里数出有几个各自独立的闭合圈。② 顺序遍历(Sequential Traversal):沿着连在一起的结构,按顺序一步步走下去。典型题「跟箭头链」——从一个标记的箭头出发,顺着链条走,报出终点的标签。③ 视觉属性对比(Visual Attribute Transfer):在不同区域之间做精细的比对。典型题「剪影匹配计数」——数出画面里有多少个剪影,是某个模板「原样平移」过来的完全相同的副本。这三类的共同点是:答案不在「看一眼的第一印象」里,而藏在「反复查、逐个比」的过程中。
值得一提的是,为了防止模型靠「背图」蒙混,每个场景都是**由确定性程序生成、再照相写实地渲染**出来的——结构可控,但画面像真实照片,逼着模型真的去「看」。
10.6% 对 96.1%,"开挂"也追不上
把题一跑,差距大到有点滑稽。
目前最强的是 GPT-5.5(开到最高推理档),也只做对了 10.6%(85 题里 9 题),而且 17 个任务里有 11 个拿了 0 分;被公认屠榜的 Claude Fable 5 更低,只有 3.5%(3 题)。对照组是三名人类,平均 96.1%(三人分别 97.6%、96.5%、94.1%),而且每题大约只花 30 秒。那让 AI「开挂」呢?研究者又试了让 Claude Code 配合 Fable 5 当工具智能体,允许它自己写代码、调用视觉库来解题——成绩确实升到了 50.6%,明显好于纯语言模型,但仍远不及人类,而且每题要耗 12–15 分钟。论文点出一个耐人寻味的死结:模型自己写的视觉代码在真实图像上并不可靠,而要发现这些代码错在哪,又恰恰需要它所缺的那种「主动观察」能力。
人看图是「闭环」,模型是「看一眼就说」
为什么会差这么多?论文给的解释,其实点破了当下多模态模型的一个结构性局限。
人类的视觉是一个闭环:我们不是一次性把整张图「拍」进脑子,而是先形成一个初步猜测,再据此把目光移到关键处去验证、修正,然后再看、再调整——认知科学几十年来一直强调,这种「主动观察」对很多任务是必需的。而今天的多模态模型,更接近「看一眼、然后描述」的一次性处理:给定一张静态图,输出一段推理或描述,缺少「根据中间的想法,主动决定下一步该看哪、再回头核对」的机制。于是面对「必须一步步查」的题,它就露馅了——这也正是为什么给它工具、让它自己写代码去「代替眼睛」,也只能补上一部分。
它说明什么,又没说明什么
结论要摆正,别读偏。
第一,这不等于「AI 看不见」:模型在「看一眼就能答」的识别、描述类任务上依然很强,ActiveVision 专门挑的是「需要主动、迭代地观察」这一类硬骨头——它测的是一个特定短板,不是全盘否定多模态能力。第二,这是一篇新研究、样本也不大:对照只有 3 名人类、共 85 道题,作者的目标是「把这个短板量化并暴露出来」,以推动更好的架构与训练目标,而不是给某个模型下最终判决。但即便如此,10.6% 对 96.1% 的悬殊,已经足够说明问题:在「像人一样反复看图」这件事上,最强的 AI 目前仍远未及格。
所以下次看到「多模态模型看图有多强」的演示时,不妨多问一句:这题是「看一眼就能答」,还是「得一步步查着答」?两者之间,可能就隔着这 85 道题量出来的鸿沟。
来源:论文《An Exam for Active Observers》(arXiv:2607.16165,作者 Jiarui Zhang、Muzi Tao、Shangshang Wang、Ollie Liu、Xuezhe Ma、Willie Neiswanger,美国南加州大学 USC,本站直接核阅论文摘要与 HTML 正文);项目站 activevision.dev(基准名称、三类任务与题例、排行榜数据出自此站)。GPT-5.5 10.6%(9/85、11/17 任务 0 分)、Claude Fable 5 3.5%、人类三人平均 96.1%(97.6/96.5/94.1)、Claude Code+Fable 5 工具智能体 50.6%、人类每题约 30 秒 vs 智能体 12–15 分钟,均出自论文与项目站。配图为项目站实测截图。
数一团乱线里有几个圈、顺着箭头走到底——这些人类 30 秒搞定的题,最强的 AI 只做对了十分之一。会「读图」不等于会「看图」,这中间隔着一整个「反复回看」的循环。


