10人团队逆袭巨头!Chance AI如何靠视觉推理登顶MMMU-Pro
type
status
date
slug
summary
tags
category
icon
password
网址
在多模态大模型(LLM)的竞争中,行业似乎一直默认一个规则:更高的图像分辨率、更多的视觉 token、更大的模型参数以及更昂贵的算力投入,是提升 AI 视觉能力的唯一路径。然而,最新一期的 MMMU-Pro 官方公开榜单却给出了一个颠覆性的答案。
一支仅有 10 人左右的创业团队,凭借 Chance Vision 1.5 拿下了 86.9% 的高分,不仅超越了谷歌的 Gemini、微软与 OpenAI 的 GPT 等基础大模型巨头,更是超过了高水平人类专家的基线。
这一轰动AI新闻界的事件,标志着多模态人工智能的发展正在从“造眼睛”(看得更清)的阶段,正式迈入“造视觉皮层”(看得更懂)的新纪元。本文将为您深度拆解 Chance AI 登顶背后的技术逻辑,探讨 Visual Agent 如何真正实现从“看见”到“洞见”的跨越。
视觉脱锚:传统多模态模型的硬伤
今天的通用多模态大模型已经具备了极强的图像识别能力,它们可以轻松辨认出照片中的猫狗、提取图片中的文字或分析基础图表。然而,一旦面对复杂的推理任务或长文本推理,传统路线的弊端就暴露无遗。
在传统的处理流程中,图片在输入阶段被一次性编码为视觉 token,随后便完全交由语言模型进行推理。随着推理链条的拉长,模型依赖的其实是被压缩后的视觉表征或文字描述,而非原始图像本身。
Chance AI 团队将这种现象定义为视觉脱锚(Visual Grounding Drift, VGD)。这意味着,尽管图片仍在输入框中,但模型的推理过程已经偏离了原始的视觉证据。一旦模型在第一眼看错了一个细节,后续的推理即使逻辑再自洽,也只是在“一本正经地胡说八道”。
例如,在识别一辆黄色跑车的测试中,ChatGPT 5.6 Pro 凭借剪刀门和改装尾翼等局部特征,将其判断为改装的 MG Cyberster;而 Chance AI 则通过持续核对前灯、车身比例及空气动力学套件,准确识别出这是小米 SU7 Ultra。这表明,通用模型极易陷入“过早锁定候选,忽略反证”的陷阱,而优秀的视觉推理系统必须具备怀疑“第一眼结论”并重新寻找证据的能力。
VIC 视觉推理回路:让 AI 拥有主动探索的“视觉皮层”
为了解决视觉脱锚问题,Chance AI 从认知科学和人类视觉处理机制中汲取了灵感。人类在观察世界时,并非平均分配注意力,而是采用“目标驱动的主动采样”机制:先形成初步假设,再寻找证据缺口,接着将视线转向特定区域进行核对,最后修正结论。
基于此,Chance AI 提出了 VIC(Visual Inference Circuits,视觉推理回路)。这套机制将“主动采样、预测校正、动态路由”的生物认知逻辑融入到了大模型的推理中:
- 形成初步假设:对输入图像进行初步感知。
- 定位证据缺口:发现当前假设中不确定或矛盾的局部特征。
- 重回原始图像:激活对应的视觉回路与 Visual Skill(视觉技能)。
- 交叉核对与更新:引入外部知识或进行细节比对,修正并输出最终结论。
在荣耀 Robot Phone 的案例中,VIC 的优势展现得淋漓尽致。仅看机身顶部的机械结构,传统模型很容易将其误判为普通的双轴云台相机。但 VIC 能够将这个局部结构放回到整机形态,并结合 MWC 2026 的发布语境,最终正确识别出这款具备物理交互能力的全新手机形态。
VIC 并非死板的工作流,而是根据任务动态路由视觉证据。它解决的核心问题是:下一眼看哪里、下一步调用什么工具,以及何时停止观察并输出结果。
Camera-First 与个人记忆:Visual Agent 的新护城河
对于一个实用的 Visual Agent 而言,真实的物理世界并没有准备好的“提示词(Prompt)”。用户往往只是举起相机随手一拍,系统必须自己去判断画面中的主体、所处的语境以及用户可能需要什么信息。
Chance AI 坚持 Camera-First 的交互设计,将相机作为第一入口。相比于聊天框输入,相机能让 AI 直接接触未被压缩的原始视觉世界。在世界人工智能大会(WAIC)、纽约时装周等高密度视觉场景中,Chance AI 顶住了反光、遮挡和信息不完整等真实环境的考验。
为了让 Visual Agent 更加实用,Chance AI 还在其论文中提出了一套个人视觉记忆机制,将记忆分为三层:
* 用户画像(Profile):相对稳定的个人偏好。
* 短期关注(Short-Term Focus):近期关注的特定主题。
* 具体观察(Observations):过往互动中积累的零碎线索。
实验数据表明,当移除这三层个人视觉记忆后,Agent 调用工具的查询相关性下降了 11.2%,端到端效用下降了 9.7%。这证明了记忆虽然不直接参与视觉识别,但它能决定 AI 在“认出物体”后,下一步应该“查什么”。这种双环机制让系统实现了“越用越聪明”的良性循环。
MMMU-Pro 登顶:小团队给 AGI 行业带来的启示
MMMU-Pro 作为多模态领域的“大学专业综合考试”,其题目涵盖图表、化学结构、医学影像等跨学科内容,极度考验模型的视觉线索串联能力。Chance Vision 1.5 的登顶,无疑为行业提供了一个新的坐标:
| 排名 | 模型 / 团队 | 成绩 (MMMU-Pro) |
| :--- | :--- | :--- |
| 1 | Chance Vision 1.5 (Chance AI) | 86.9% |
| 2 | GPT-4o (2024-11-20) | 83.1% |
| 3 | Gemini 1.5 Pro (002) | 81.3% |
| 4 | Claude 3.5 Sonnet | 79.5% |
| 5 | 高水平人类专家基线 | 85.0% |
这一成绩表明,视觉推理的突破并不完全取决于模型的体量,更有效率的观察方法和推理机制同样能产生质的飞跃。
随着具身智能、智能眼镜等硬件的快速兴起,如何让机器拥有真正的“视觉与空间大脑”已成为下一个行业风口。Chance AI 的成功实践证明,从“看见”走向“洞见”,才是下一代多模态 大模型 竞争的分水岭。
Loading...
.png?table=collection&id=cbe6506e-1263-8358-a4d7-07ce62fcbb3f&t=cbe6506e-1263-8358-a4d7-07ce62fcbb3f)