2025 年 10 月 15 日,Scale AI 发布 VisualToolBench(VTB),一个专门考察多模态大模型(MLLM)"能不能主动用工具处理图像"的基准。它把评测范式从 think about images(对着一张静态图作答)推到 think with images(把图像当成可裁剪、翻转、增强的工作区)。结果很刺眼:在 1204 个开放任务上,最强模型 GPT-5-think 的通过率只有 18.68%;而论文的错误分析显示,超七成失败不是逻辑推理出错,而是"看不清、认不出"——视觉感知本身才是当前多模态模型的真正短板。
从"看图"到"用图":一个被现有基准漏掉的维度
现实里用户上传的照片很少是干净的:旋转、欠曝、杂乱、构图差。一个真正可用的多模态模型,应当能先动手把图像掰正、放大、提亮,再据此推理。但论文指出,ScienceQA、MathVista、MMMU、ChartQA 等主流基准都停留在 think about images 范式——图像是静态输入,模型只需"看"再"答",从不被要求"动"。
VTB 的靶子正是这个空白。它要求模型满足四条设计原则:关键视觉内容必须不易直接获取(non-trivial visual perception,逼着模型去做变换);任务贴近真实场景;不明确告知该用哪个工具(implicit tool-use,模型要自己判断何时、怎么调用工具);以及多步组合推理。论文的表 1 把 VTB 与既有基准逐项对照:动态视觉工具、rubric 评分、专家出题、推理、多轮交互,五者同时具备的只有 VTB。
1204 个"必须动手"的任务怎么造
VTB 共含 1204 个开放题和 2893 张图,按领域五等分:STEM 238 题(19.7%)、医疗 238 题(19.7%)、金融 243 题(20.2%)、体育 240 题(20.0%)、通用 245 题(20.4%)。单轮 603 题、多轮 601 题,后者涵盖追问澄清(Follow-up Test)、跨图时序推理(Temporal Reasoning)和逐步递进的推理(Progressive Reasoning),平均每题 2 到 5 轮对话。
难度是"造"出来的。所有题目由具有领域专长的人类作者撰写,走一条多阶段管线:培训→出题→用 o3、Gemini-2.5-pro、o4-mini 三个模型预评分→双重独立审查。一条硬门槛是:至少两个模型答错,题目才被保留。作者还要为每题提供参考答案、参考工具轨迹和评分细则,保证"动图"不是可选项而是解题的必要条件。
从公开数据集里能直接看到题目长什么样:读一张工程图纸的"料号尺寸列"算出两个零件的直径和;把一张倒置的棋盘裁正后判断白方能否一步将杀;或是在一张被蓝色污渍遮挡的血型表里推断亲子血型组合。这些题的关键信息都藏在需要被定位、放大、翻转才能读出的细节里。
怎么打分:rubric 与"关键项"门槛
VTB 给模型一个含六个工具的标准化接口:核心是 python_image_processing(可做裁剪、旋转、翻转、亮度/对比度调整、增强,并反复把处理结果重新喂回模型),辅以 Python 解释器、网页搜索、计算器、网页文本提取和历史天气查询。每题最多 20 次工具调用,而人类参考答案通常不到 5 次——这本身就是一条差距的线索。
评分不靠"对/错"二值,而靠 7777 条细则(rubric),覆盖视觉理解、真实性、指令遵循、推理、表达五个维度。每条细则被赋予 1 到 5 的权重,权重 4 或 5 的细则被标为"关键项":只有当一条回答满足全部关键项,才计入通过率(APR,Average Pass Rate);此外还有一个给部分分的 ARS(Average Rubric Score),按满足细则的加权比例计算。为支撑大规模评测,评分由 o4-mini 自动完成,与人工标注的整体对齐率为 88.1%——客观细则达 91.7%,主观细则只有 74.0%。
结果:瓶颈在感知,不在逻辑
论文评测了 16 个带函数调用能力的模型。GPT-5-think 以 18.68% 的 APR 登顶,GPT-5 为 16.96%、o3 为 13.74%;11 个模型低于 10%。开源模型里最好的 Llama4-Scout 只有 1.58%、Llama4-Maverick 1.41%,与最强闭源相差约一个数量级。多轮任务整体比单轮更难,因为错误会在 2 到 5 轮对话里累积。
最具解释力的是错误归因:对 GPT-5、Gemini-2.5-pro、Claude-opus-4.1 三个模型抽样,视觉感知错误分别占 71.73%、78.01%、82.11%,而推理错误只有 9% 到 12%,计算错误更是普遍低于 6%。也就是说,模型不是"没想对",而是"第一步就没看清"。
工具使用数据进一步印证这一点。调用量不是越多越好:o3 总共调了 16116 次工具,成绩却不如只调 10212 次的 GPT-5;Claude 系列的工具调用主动性高达约 95%,APR 却普遍低于 6.5%。消融实验显示,去掉工具后 GPT-5 掉 11 到 14 个百分点,而 Gemini-2.5-pro 反而提升 2.7 个百分点——作者推测,前者靠迭代图像编辑补偿较弱的原生感知,后者原生视觉更强、却因不必要地调用工具而受损。python_image_processing 是使用最频繁的工具,在 GPT-5 上占全部工具调用的 92%。
一年后:范式被接受,能力缺口仍在
VTB 的价值不在一次性榜单,而在它补上的那类评测维度。官方 leaderboard 仍在持续更新:截至抓取时,榜首是 Muse Spark 1.1(约 44.77% APR),其后是 GPT-5.4(29.17%)、Gemini-3.1-Pro(28.97%),论文时的最强模型 GPT-5-think(18.68%)已落到第六名附近。一年间最好成绩翻了约 2.4 倍,但通过率仍不足一半,说明"用工具看图"的短板在缩小、却远未关闭。
仍需保留几点边界:评分依赖 LLM-as-judge,主观细则的对齐率(74.0%)明显偏低;数据与评测均由 Scale AI 单方构建,结果尚无大规模第三方复现;而随着榜单被反复刷,benchmark 本身也存在被针对性拟合的风险。对 AI 从业者而言,VTB 真正提醒的是——当多模态模型被包装进 agent、要替人读图做决策时,"能不能把图看对"比"推理多强"更早地卡住上限。