18个顶级多模态模型,在一款卖了3亿份的方块游戏里集体考砸了。Claude Opus 4.6——目前公认的最强选手——整体任务成功率勉强踩在41%。一旦任务要求穿过四个逻辑跳板,这个数字直接俯冲至12%。这不是标题党,是美团 LongCat 团队最新抛出的 MineExplorer 基准给出的真实成绩单。如果你认为“看懂图片+生成文本”就等于具备智能,是时候醒醒了。
一块方碑:813个实例为何专挑Minecraft下手
开放世界不是噱头,是照妖镜
大部分多模态评测还停留在“这张图里有几只斑马”的水平。封闭图像、固定选项、单一回合,模型猜对就算赢。MineExplorer 的狠劲恰恰在于它撕掉了这层温室薄膜。《我的世界》没有任何预设路径,每一棵树、每一格方块都可以被改变。一个任务需要几分钟甚至十几分钟才能完成,中间蕴含着连续的视觉观测、空间推理和动作决策。团队用手工方式标注了 813 个长程任务实例,每一个都经过了人工验证,不是自动生成的数据泥潭。这种“脏活累活”换来的,是一面能把最前沿模型照出原形的镜子。
任务设计里藏着一把会折叠的刀子
MineExplorer 真正的残酷之处,在于它把“多跳依赖”做成了任务的内在骨架。简单说,一个任务拆开来可能包含若干前置条件:先获取木材,再合成工作台,然后制造木镐,最后挖掘石头——任何一环断裂,后续步骤就无从谈起。评测覆盖了 1跳至4跳不等的任务链,跳数增加意味着对模型规划能力和长期记忆的压力指数级放大。结果很诚实:1跳任务,Claude 能拿下77%;4跳任务,只剩12%。每多一跳,不是线性下降,而是对半砍。这把折叠刀,划开的是模型当前“理解”与“执行”之间那条还没人填平的深沟。
史上最骨感的数据:18个模型,仅一个过40%
除了 Claude Opus 4.6 勉强守住四成,其余17个模型全部倒在40%以下,有些成绩甚至低到个位数。这不是普通的多模态基准里“你高我低”的排位赛,而是一场集体无能的宣告。当一个基准让几乎所有参与者都无法达到及格线时,它就不再只是一次考试,而变成了一份行业诊断报告。报告中清清楚楚写着一行字:我们离开放环境下的通用操作智能,还隔着不止一代技术的距离。
导航——这个最不起眼的环节,吞掉了六成失败率
近60%的失败,不是不会做,是根本到不了
在很多人想象中,视觉语言模型看懂屏幕,就应该能走到正确的位置。但 MineExplorer 的失败分析毫不留情地戳破这个幻想:接近60%的任务失败源于导航失败。模型常常在距离目标只差几格的地方反复打转,甚至朝反方向一去不回头。它或许清楚地知道“前方有棵树”,却无法将眼前的像素阵列转化成持续稳定的空间移动序列。一次错误的转向,意味着整个长程任务从根部坏死。感知似乎在线,行动却早已离线——导航成了整套系统里最短、最致命的木板。
“我在哪”这道题,模型还没学会
人类玩家在《我的世界》里走一遍就形成的空间心智地图,对当前的多模态模型来说仍是一片空白。它们缺乏真正的自身位姿感知,也缺乏从连续视觉流中推断动态位置的能力。任务日志显示,模型会在同一个山谷里迷路几百步,拥有完美材质识别却找不到回家路。这暴露出一个深层问题:视觉理解与空间推理之间存在一条模型尚无法跨过的暗河。如果连在虚拟方块世界里都找不着北,我们又如何相信它们能控制机器人安然穿过一间真实的客厅?
为什么所有模型一进游戏就腿软
不是游戏太难,是评测太真实
有人可能会说,《我的世界》终究是个复杂环境,模型表现差情有可原。但换一个角度看,这恰恰点明了当前评测体系的集体逃避心理。大多数基准选择把问题简化成选择题,模型只需吐出一个字母。MineExplorer 则把模型扔进一个必须连续交互、没有提示、需要自己规划步骤的开放沙盒,要求它在分钟级时间尺度上维持一致的行为逻辑。这种真实感,恰恰是任何想落地应用的具身智能系统迟早要面对的。长程任务不是附加题,而是通用智能的必答题。
感知跟行动之间,还缺一座桥
评测里另一个值得玩味的现象是,很多模型在纯描述性任务上表现不俗——能准确说出周围环境里有什么。可一旦需要把描述转化为一连串目标导向的动作,就出现严重的脱节。它看得见、说得出,却做不了。美团 LongCat 团队用开源数据为这份“眼高手低”提供了定量证据。桥的两端,一头是日渐成熟的视觉语言能力,另一头是亟待重构的层次化规划与动作执行能力。中间那根摇摇欲坠的绳索,就是当前整个多模态智能体研究的核心战场。
头脑发达,四肢简单的新定义
过去我们嘲笑传统机器人“头脑简单四肢发达”,而对于多模态模型,这个局面反了过来:它们拥有复杂精细的表示能力,却在开放环境里暴露出极为脆弱的行动力。一个微小的视觉扰动、一瞬间的注意力偏移,就能让整个任务流崩盘。MineExplorer 的实例日志里充满了这种令人扼腕的瞬间——模型兢兢业业完成了前面所有步骤,最后一步因找不到目标方块而功亏一篑。这提醒我们,下一代模型的设计不能再把动作仅仅当作输出层的附加项,而必须在内部世界模型和决策层级上做出根本性改变。
开源之后,整个行业该清醒了
别再拿静态榜刷存在感
MineExplorer 已经全面开源。这意味任何一个实验室都可以把自家模型放进去,看看在真正开放连续的交互任务里能撑多久。那些在 VQA、MMBench 等静态榜单上卷到小数点后两位的分数,在这种基准面前会显得苍白无力。当一个任务要求模型在虚拟世界里生存几分钟而不是回答一秒钟的问题,性能的优劣不再由参数量决定,而是由模型内部因果推理、空间记忆和动作一致性这些更根本的东西决定。静态榜单刷不出通用智能,动态基准测出来的才叫真功夫。
这场考试,目前没人及格
41% 的成功率,某种意义上比零分更刺痛人心。它表明方向可能没错,但脚下的路还极其漫长。MineExplorer 这只黑盒,打开的是整个具身智能领域的软肋:长程任务的稳定执行。当一项技术连在约定好的游戏规则里都难以保持连续数分钟的成功行为,我们不得不重新审视那些关于“AGI 就在拐角处”的乐观叙事。美团 LongCat 交出的不仅是一份评测报告,更是一记砸在行业桌面上的警钟——空谈感知精度没用,做出能真正走完一整段路、不迷路的智能体,才是下一个硬核山头。

