
一、网站概况
MMBench是一个专门用于评测视觉语言模型(Vision-Language Model, VLM)能力的开源基准测试平台,由上海人工智能实验室(Shanghai AI Laboratory)联合南洋理工大学、香港中文大学、新加坡国立大学、浙江大学等多家机构共同研发。该项目的核心目标是回答一个问题:当指令微调的多模态模型层出不穷时,如何系统、客观地衡量这些模型的多维度能力。
官网提供排行榜、文档、GitHub仓库入口以及在线评测服务,数据集包含约3000道多选题,覆盖目标检测、文字识别、动作识别、图像描述、关系推理等20余个细粒度评测维度。需要特别说明的是,根据官网公告,MMBench的在线评测服务将于2026年3月31日起停止运营,对应排行榜也将不再更新,但数据集、论文及评测方法仍可通过官网和GitHub获取。
二、核心功能详解
循环评测(Circular Evaluation)
这是MMBench最具特色的功能设计。传统的多选题评测通常只进行一次选项匹配,模型猜对的概率较高。MMBench的做法是将同一道题的选项进行循环位移(如ABCD变为BCDA),让模型重复作答4次,只有4次全部回答一致才算通过。相比传统的一次性Top-1准确率评测,这种方式使平均准确率降低了10%~20%,有效减少了模型靠运气蒙对答案带来的噪声干扰,让评测结果更接近模型的真实能力。
基于ChatGPT的答案匹配
多模态模型在回答选择题时,输出格式往往不规范——有时会输出完整句子,有时会附带解释,有时甚至不按指令来。MMBench引入了一种基于ChatGPT的答案提取方法,通过元指令(Meta Instruction)和上下文示例(In-context Examples)引导ChatGPT将模型的任意输出匹配到最合理的选项上。如果所有选项都与模型输出含义明显不符,则输出E表示无法匹配。这一设计显著提升了答案提取的准确率,避免了因格式问题导致的误判。
多维度能力画像
MMBench的评测维度并非简单的”看图问答”,而是从感知(perception)和推理(reasoning)两个层面出发,逐步细化为20多个具体维度,包括物体定位、文字识别、动作理解、空间关系推理、因果逻辑等。用户可以通过排行榜查看不同模型在各个维度上的详细得分,了解模型的强项和短板,而非仅仅获得一个笼统的综合分数。
三、使用教程/操作指南
获取数据集
访问官网首页点击”Download”按钮,或在GitHub仓库中找到数据下载链接。数据集包含图片和对应的多选题标注文件,格式为JSON,使用者需要同意相关使用条款。
本地评测
下载数据集后,在本地环境中加载自己的多模态模型,按照官方文档提供的评测脚本运行。核心步骤包括:将每道题的图片和问题输入模型,收集模型输出,然后使用官方提供的ChatGPT匹配脚本将输出转换为A~E的选项字符。
使用循环评测
循环评测需要针对每道题生成4个选项顺序不同的变体,分别送入模型推理,再检查4次预测是否指向同一个真实答案。官方代码中已封装了该逻辑,用户只需按照文档配置模型接口即可。
查看排行榜
在Leaderboard页面可以浏览历史上各模型的评测排名和各维度得分。需要注意的是,由于在线服务即将停止,排行榜数据已冻结,建议以论文和官方发布的数据为准。
注意事项
使用ChatGPT进行答案匹配需要OpenAI API密钥,会产生一定的调用成本;数据集中的图片版权归属于原始来源,仅限研究用途;评测你的模型时,务必使用与官方一致的系统提示词和推理参数,否则结果不具可比性。
四、内容与资源质量
MMBench的数据集规模约3000道多选题,相比早期的多模态评测基准(如VQA v2的数十万题量)不算大,但胜在维度划分精细、标注质量高。题目来源于公开数据集和人工筛选,每一道题都经过多轮校验以确保正确答案无歧义。
从更新频率看,MMBench自2023年发布论文(arXiv:2307.06281)以来,经历了多次版本迭代和排行榜更新,但核心评测逻辑保持稳定。所有数据、代码和论文均以开源形式发布在GitHub上,遵循学术研究友好的使用许可。版权方面,数据集本身由学术机构整理,图片素材来自已有公开数据集,使用者需自行注意原始图片的版权约束。
与同类基准(如SEED-Bench、MM-Vet、MMMU)相比,MMBench的差异化优势在于循环评测的稳定性和答案匹配的容错性,这两点被后续不少评测工作引用和借鉴。
五、适用人群与场景
适合人群
第一种是从事多模态模型研发的研究者和工程师,他们需要一个可靠的基准来横向对比自己的模型与业界水平。第二种是关注VLM能力边界的学术研究人员,MMBench的分维度得分有助于分析模型的具体失败模式。第三种是企业在选型开源多模态模型时的评估参考。
典型使用场景
场景一:某团队训练了一个新的视觉语言模型,将其在MMBench上跑分,发现”关系推理”维度得分明显偏低,于是针对性地补充了推理类训练数据。场景二:研究生撰写多模态综述论文时,引用MMBench的循环评测结果来说明不同模型的稳健性差异。场景三:企业技术选型时,通过对比候选模型在MMBench各维度的得分分布,选择更符合业务需求(如偏重文字识别而非物体定位)的模型。
不适合人群
普通网民或非技术背景的用户不适合直接使用MMBench——它不是一个面向消费者的应用,没有图形化的在线试用入口(评测服务也已停止),需要一定的编程能力才能跑通评测流程。
六、优缺点分析
优点
- 循环评测设计有效抑制了随机猜测带来的虚高分数,结果更加稳健可信。
- ChatGPT辅助的答案匹配大幅降低了对模型输出格式的依赖,减少了误判。
- 20余个细粒度维度提供了丰富的模型能力画像,而非单一总分。
- 完全开源,数据集和代码均可免费获取,学术可复现性高。
缺点
- 在线评测服务已宣布停止,排行榜不再更新,对新模型的持续跟踪能力丧失。
- 数据集规模约3000题,覆盖的场景相对有限,难以反映模型在开放域任务上的表现。
- 使用ChatGPT做答案匹配引入了外部依赖,评测成本和对OpenAI服务的稳定性要求较高。
| 对比项 | MMBench | SEED-Bench | MM-Vet |
|---|---|---|---|
| 题目数量 | 约3000 | 约19000 | 约200 |
| 评测方式 | 循环多选题 | 单选题 | 开放式问答+GPT评分 |
| 维度数量 | 20+ | 12 | 6大能力 |
| 在线服务 | 已停止 | 可用 | 可用 |
| 主要优势 | 稳健性高 | 规模大 | 开放性强 |
综合来看,MMBench在多模态模型评测领域具有开创性贡献,其循环评测和答案匹配方法已被广泛认可。但服务停止后,它更适合作为历史基准和论文引用对象,活跃的在线评测需求需转向MM-Vet、MMMU等仍在维护的替代平台。
数据统计
数据评估
本站米吧导航提供的MMBench都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由米吧导航实际控制,在2026年9月12日 19:25收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,米吧导航不承担任何责任。
常见问题
1. MMBench 是做什么的?
MMBench 是一个多模态模型评测基准,主要考察模型的感知和推理能力。它用约 3000 道选择题覆盖目标检测、文字识别、动作识别、图像描述、关系推理等 20 多个细分维度,用来评估模型是不是一个全面的选手。
2. MMBench 数据集包含多少题目?
首页提到大约有 3000 道选择题,评测维度比较细,包括目标检测、文字识别、动作识别、图像描述、关系推理等,一共 20 多个方向。具体题型和划分可以看 Documentation。
3. 什么是 Circular Evaluation?
Circular Evaluation 是 MMBench 用来提高评测可靠性的一种做法:同一道多选题会把选项顺序打乱后重复多次,模型每次都能给出相同答案才算通过。相比传统一次性评测,平均准确率通常会下降 10% 到 20%,目的是减少噪声、让结果更容易复现。
4. MMBench 数据集怎么下载和使用?
官网首页有 Download 入口,具体使用方式可以查看 Documentation(Docs)。下载地址和加载步骤以官方文档为准。
5. MMBench 在线评测和排行榜还在运行吗?
根据官网公告,MMBench 在线评测服务自 2026 年 3 月 31 日起停止运营,对应的排行榜也不再更新。需要最新信息可以访问官网 MMBench 了解详情,或联系 opencompass@pjlab.org.cn。
相关导航


AGI-Eval
PubMedQA

LLMEval3

OpenCompass





