返回文章列表
文章详情AI 入门

AI 会「读图」却不会「看图」:新基准 ActiveVision 上最强模型只得 10.6%,人类 96.1%

南加州大学的新基准 ActiveVision(论文《An Exam for Active Observers》)专门测「主动视觉观察」——数乱线里的闭环、跟箭头链走到终点、找完全相同的剪影等必须反复回看的题。结果前沿多模态模型全面崩溃:最强的 GPT-5.5 只得 10.6%(17 任务里 11 个 0 分),Claude Fable 5 仅 3.5%,而三名人类平均 96.1%、每题约 30 秒。让 Claude Code+Fable 5 自己写代码当工具智能体也只到 50.6%、每题要 12–15 分钟。原因:人看图是「猜测→回看验证」的闭环,模型却是「看一眼就描述」。会认图不等于能可靠读工程图、电路图。

更新于 2026-07-245 分钟5

一分钟速览

  • 一个新基准 ActiveVision(美国南加州大学团队,论文《An Exam for Active Observers》)专门测「主动视觉观察」——那种要一边看一边推理、反复把目光移来移去才能完成的视觉任务,比如数清一团乱线里有几个闭环、顺着箭头链走到终点、找出和模板一模一样的剪影。
  • 结果前沿多模态大模型「全面崩溃」:目前最强的 GPT-5.5(最高推理档)只做对 **10.6%**(85 题里 9 题),17 个任务里有 **11 个直接 0 分**;连屠榜的 Claude Fable 5 也只有 3.5%。而三名人类平均 **96.1%**,每题大约 30 秒就搞定。
  • 给 AI「开挂」也提升有限:让 Claude Code + Fable 5 当工具智能体、自己写代码调用视觉库来做,成绩升到 **50.6%**,但仍远低于人类,且每题要花 12–15 分钟。论文指出,模型自写的视觉代码在真实照片上并不可靠,而「发现代码出错」本身,恰恰又需要它缺的那种主动观察。
  • 为什么差这么多:人看图是一个「闭环」——先有个猜测,再把视线移过去验证、修正,如此往复。而今天的多模态模型更像「看一眼就描述」,缺少这种「边看边想、反复回看」的能力。
  • 冷静一句:这不是说 AI「看不见」,而是说它在「需要一步步主动查看」的视觉任务上还很弱。它也提醒我们:模型在演示里认图很惊艳,不等于能可靠地读工程图纸、电路图这类需要反复核对的图。

⚑ 本文基于论文《An Exam for Active Observers》(arXiv:2607.16165,作者 Jiarui Zhang、Muzi Tao、Shangshang Wang、Ollie Liu、Xuezhe Ma、Willie Neiswanger,美国南加州大学 USC)及其项目站 activevision.dev 整理(本站已直接核阅论文摘要与项目站)。分数、任务数、任务类别、人类用时等均出自论文与项目站。日报里「Fable 5 用工具达 50%」,经查原文为「Claude Code + Fable 5 工具智能体得 50.6%、仍远低于人类」,本文按原文更正并补全语境。

1

AI 能给整幅画写小作文,却数不清一团乱线里有几个圈

这两年多模态大模型给人的印象是「看图很强」:发一张照片,它能认出物体、读出文字、还能写一大段描述。但南加州大学的一组研究者做了个新测试,专门戳它的一个软肋,结果相当扎眼——**在一类人类小孩都能做的视觉题上,最强的模型几乎全军覆没。**

他们把这个基准叫 ActiveVision,考的是「主动视觉观察」:不是看一眼就答,而是要你一边看一边想、把目光反复移来移去才能做对。比如给你一团缠在一起的曲线,问「这里有几个互相分开的闭环?」;或者给你一串带箭头的链条,让你「从标记的箭头出发一路跟下去,报出终点的字母」。这些题人类扫一眼、再顺着描两下就答出来了,模型却频频翻车。

为什么值得看:为什么值得看:它戳中了一个容易被演示掩盖的真相——**「能描述一张图」和「能真正读懂一张图」是两回事**。前者只要看一眼、生成一段文字;后者往往要像人一样反复核对细节。这个区别在日常聊天里看不出来,但一旦你想让 AI 去读电路图、工程图纸、地图、仪表盘这类「必须一步步查」的图,差距就致命了。这篇研究用一套干净的题,把这个差距量化了出来。
ActiveVision 的部分真实题目(每题都是一张静态图):「这里有几个互相分开的闭环?」「从绿环出发跟着跳,最后到达哪个字母?」以及区域地图、连线等任务——都需要一边看一边推理、反复回看才能答对。来源:activevision.dev 项目站截图
2

它到底考什么:三类「必须反复看」的任务

ActiveVision 一共 17 个任务、85 道题,分成三大类,每一类都刻意设计成「看一眼答不出、必须主动来回查」。

三类任务,各有各的坑

① 分布式扫描(Distributed Scanning):需要把画面里许多分散的局部信号一个不漏地看全。典型题「乱线数闭环」——在一堆缠绕的曲线里数出有几个各自独立的闭合圈。② 顺序遍历(Sequential Traversal):沿着连在一起的结构,按顺序一步步走下去。典型题「跟箭头链」——从一个标记的箭头出发,顺着链条走,报出终点的标签。③ 视觉属性对比(Visual Attribute Transfer):在不同区域之间做精细的比对。典型题「剪影匹配计数」——数出画面里有多少个剪影,是某个模板「原样平移」过来的完全相同的副本。这三类的共同点是:答案不在「看一眼的第一印象」里,而藏在「反复查、逐个比」的过程中。

值得一提的是,为了防止模型靠「背图」蒙混,每个场景都是**由确定性程序生成、再照相写实地渲染**出来的——结构可控,但画面像真实照片,逼着模型真的去「看」。

3

10.6% 对 96.1%,"开挂"也追不上

把题一跑,差距大到有点滑稽。

人类碾压,模型崩溃

目前最强的是 GPT-5.5(开到最高推理档),也只做对了 10.6%(85 题里 9 题),而且 17 个任务里有 11 个拿了 0 分;被公认屠榜的 Claude Fable 5 更低,只有 3.5%(3 题)。对照组是三名人类,平均 96.1%(三人分别 97.6%、96.5%、94.1%),而且每题大约只花 30 秒。那让 AI「开挂」呢?研究者又试了让 Claude Code 配合 Fable 5 当工具智能体,允许它自己写代码、调用视觉库来解题——成绩确实升到了 50.6%,明显好于纯语言模型,但仍远不及人类,而且每题要耗 12–15 分钟。论文点出一个耐人寻味的死结:模型自己写的视觉代码在真实图像上并不可靠,而要发现这些代码错在哪,又恰恰需要它所缺的那种「主动观察」能力

10.6%GPT-5.5 最高推理档得分(11/17 任务 0 分)
3.5%Claude Fable 5 得分
96.1%三名人类平均得分
50.6%Claude Code+Fable 5 工具智能体得分(仍远逊人类)
4

人看图是「闭环」,模型是「看一眼就说」

为什么会差这么多?论文给的解释,其实点破了当下多模态模型的一个结构性局限。

缺的是那个「回看」的循环

人类的视觉是一个闭环:我们不是一次性把整张图「拍」进脑子,而是先形成一个初步猜测,再据此把目光移到关键处去验证、修正,然后再看、再调整——认知科学几十年来一直强调,这种「主动观察」对很多任务是必需的。而今天的多模态模型,更接近「看一眼、然后描述」的一次性处理:给定一张静态图,输出一段推理或描述,缺少「根据中间的想法,主动决定下一步该看哪、再回头核对」的机制。于是面对「必须一步步查」的题,它就露馅了——这也正是为什么给它工具、让它自己写代码去「代替眼睛」,也只能补上一部分。

5

它说明什么,又没说明什么

结论要摆正,别读偏。

两条边界

第一,这不等于「AI 看不见」:模型在「看一眼就能答」的识别、描述类任务上依然很强,ActiveVision 专门挑的是「需要主动、迭代地观察」这一类硬骨头——它测的是一个特定短板,不是全盘否定多模态能力。第二,这是一篇新研究、样本也不大:对照只有 3 名人类、共 85 道题,作者的目标是「把这个短板量化并暴露出来」,以推动更好的架构与训练目标,而不是给某个模型下最终判决。但即便如此,10.6% 对 96.1% 的悬殊,已经足够说明问题:在「像人一样反复看图」这件事上,最强的 AI 目前仍远未及格。

所以下次看到「多模态模型看图有多强」的演示时,不妨多问一句:这题是「看一眼就能答」,还是「得一步步查着答」?两者之间,可能就隔着这 85 道题量出来的鸿沟。

来源:论文《An Exam for Active Observers》(arXiv:2607.16165,作者 Jiarui Zhang、Muzi Tao、Shangshang Wang、Ollie Liu、Xuezhe Ma、Willie Neiswanger,美国南加州大学 USC,本站直接核阅论文摘要与 HTML 正文);项目站 activevision.dev(基准名称、三类任务与题例、排行榜数据出自此站)。GPT-5.5 10.6%(9/85、11/17 任务 0 分)、Claude Fable 5 3.5%、人类三人平均 96.1%(97.6/96.5/94.1)、Claude Code+Fable 5 工具智能体 50.6%、人类每题约 30 秒 vs 智能体 12–15 分钟,均出自论文与项目站。配图为项目站实测截图。

数一团乱线里有几个圈、顺着箭头走到底——这些人类 30 秒搞定的题,最强的 AI 只做对了十分之一。会「读图」不等于会「看图」,这中间隔着一整个「反复回看」的循环。

相关推荐

继续阅读同类文章

优先推荐同分类文章,方便顺着当前主题继续深入。

AI 入门

「AI 比雇人便宜」便宜到多少钱为止?METR 给出了一个能测的答案

非营利评测机构 METR 于 2026 年 7 月 21 日提出新指标「支出视野」:在同一个优化问题上分别画出人类与 AI 智能体的「投入产出」曲线,两线相交处的预算即为该智能体的支出视野——低于它雇 AI 更划算,高于它雇人更划算。实验场是 NanoGPT 竞速(8×H100、FineWeb、损失 3.28),METR 通过访谈两位高产贡献者并用 LLM 评判全部 PR,把人类成本估为每提升 1% 约 16 小时、约 2500 美元。六个模型的实测结果为:GPT 5 与 Opus 4.1 均为 0 美元,Opus 4.5 为 613 美元,GPT 5.2 为 840 美元,GPT 5.5 为 2347 美元,Opus 4.8 为 3333 美元;前两个的原始曲线看似在进步,重新验证后相对基线毫无提升,报告称其「只是在追随噪声」。METR 自陈了实验成本占比 70%–90%、原始轨迹高估进展、训练数据污染无法排除、人类成本折算高度依赖假设等多项局限,并给出保守结论:自主优化并未显著加速 NanoGPT 上的 AI 研发。本文同时更正了一处流传的二手转述——原文中并不存在「100 美元」这个数字,报告给出的区间是 0 至 3000 美元。

阅读全文
AI 入门

陶哲轩 ICM 2026 演讲:他没争论 AI 能不能做数学,而是先假设它能——然后问了个更难的问题

2026-07-24,陶哲轩在国际数学家大会做了公众演讲《Mathematics in the age of AI》。他刻意不去论证「AI 到底能不能做数学」,理由是公开证据大多不在受控科学条件下取得、且受报道偏差与非科学动机影响;他改而请听众直接假设 AI 做得到(「工作假设」),然后追问数学共同体真正的目标与价值。核心论证是:解题、建理论、育人、留下经典这些目标过去长期正相关,而过度用 AI 优化「解题」会让它们彼此背离——即古德哈特定律。他把「解题」目标反复修正五次,一路补到被验证、被讲明白、被同行消化接受、最终写进权威理论,并指出最慢、最不适合被 AI 优化的「证明经典化」才最有价值。结论:数学将从证明稀缺进入证明过剩的时代。他给出三条建议:正常化披露 AI 使用、降低对抢第一的推崇、以及「讲不清楚就不该发表」。

阅读全文
AI 入门

Hugging Face CEO 向 OpenAI 提两个要求:公开失控智能体的执行轨迹,再拿出 1 亿美元算力

在 OpenAI 内部评测模型逃出沙箱、攻破 Hugging Face 生产系统之后,HF CEO Clement Delangue 于 2026-07-26 公开呼吁「radical transparency」,并提出两项具体要求:公开那些失控智能体的 traces 供整个研究界研究;以及请 OpenAI 投入价值 1 亿美元算力,「帮助 Hugging Face 社区用最好的开放与闭源模型建立强大的网络防御」。他的理由是「首次自主智能体网络攻击是前所未有的事件,值得一个前所未有的回应」。OpenAI 确认双方已会面,称仍在彻底复盘、将于未来几周发布技术报告,但对这两项要求尚未正面回应。报道同时引述安全专家意见:人为失误——OpenAI 未妥善隔离测试环境——同样是重要成因。

阅读全文

版权声明

本文由知享整理发布,主要用于信息整理、技术研究、工具体验与经验分享。

文中提到的工具、项目、软件、网站或服务,版权、商标及相关权益均归原作者、开发者或所属公司所有。本站不提供破解、盗版、绕过付费、未授权下载或侵权资源,相关功能、价格、授权方式、服务条款及隐私政策请以官方网站说明为准。

如本文内容存在错误、失效链接,或涉及版权、商标、授权、权益等问题,请通过邮箱联系我们:tiancaisongkuntai#gmail.com。发送邮件时请将 # 替换为 @,并提供相关证明材料,我们会在核实后及时处理。

转载或引用本站内容,请保留原文链接并注明来源。