欢迎入驻!

MMBench

3天前更新 15 00

一套面向视觉语言模型的开源评测体系,涵盖20多个维度。

收录时间:
2026-09-12

一、网站概况

MMBench是一个专门用于评测视觉语言模型(Vision-Language Model, VLM)能力的开源基准测试平台,由上海人工智能实验室(Shanghai AI Laboratory)联合南洋理工大学、香港中文大学、新加坡国立大学、浙江大学等多家机构共同研发。该项目的核心目标是回答一个问题:当指令微调的多模态模型层出不穷时,如何系统、客观地衡量这些模型的多维度能力。

官网提供排行榜、文档、GitHub仓库入口以及在线评测服务,数据集包含约3000道多选题,覆盖目标检测、文字识别、动作识别、图像描述、关系推理等20余个细粒度评测维度。需要特别说明的是,根据官网公告,MMBench的在线评测服务将于2026年3月31日起停止运营,对应排行榜也将不再更新,但数据集、论文及评测方法仍可通过官网和GitHub获取。

二、核心功能详解

循环评测(Circular Evaluation)

这是MMBench最具特色的功能设计。传统的多选题评测通常只进行一次选项匹配,模型猜对的概率较高。MMBench的做法是将同一道题的选项进行循环位移(如ABCD变为BCDA),让模型重复作答4次,只有4次全部回答一致才算通过。相比传统的一次性Top-1准确率评测,这种方式使平均准确率降低了10%~20%,有效减少了模型靠运气蒙对答案带来的噪声干扰,让评测结果更接近模型的真实能力。

基于ChatGPT的答案匹配

多模态模型在回答选择题时,输出格式往往不规范——有时会输出完整句子,有时会附带解释,有时甚至不按指令来。MMBench引入了一种基于ChatGPT的答案提取方法,通过元指令(Meta Instruction)和上下文示例(In-context Examples)引导ChatGPT将模型的任意输出匹配到最合理的选项上。如果所有选项都与模型输出含义明显不符,则输出E表示无法匹配。这一设计显著提升了答案提取的准确率,避免了因格式问题导致的误判。

多维度能力画像

MMBench的评测维度并非简单的”看图问答”,而是从感知(perception)和推理(reasoning)两个层面出发,逐步细化为20多个具体维度,包括物体定位、文字识别、动作理解、空间关系推理、因果逻辑等。用户可以通过排行榜查看不同模型在各个维度上的详细得分,了解模型的强项和短板,而非仅仅获得一个笼统的综合分数。

三、使用教程/操作指南

获取数据集

访问官网首页点击”Download”按钮,或在GitHub仓库中找到数据下载链接。数据集包含图片和对应的多选题标注文件,格式为JSON,使用者需要同意相关使用条款。

本地评测

下载数据集后,在本地环境中加载自己的多模态模型,按照官方文档提供的评测脚本运行。核心步骤包括:将每道题的图片和问题输入模型,收集模型输出,然后使用官方提供的ChatGPT匹配脚本将输出转换为A~E的选项字符。

使用循环评测

循环评测需要针对每道题生成4个选项顺序不同的变体,分别送入模型推理,再检查4次预测是否指向同一个真实答案。官方代码中已封装了该逻辑,用户只需按照文档配置模型接口即可。

查看排行榜

在Leaderboard页面可以浏览历史上各模型的评测排名和各维度得分。需要注意的是,由于在线服务即将停止,排行榜数据已冻结,建议以论文和官方发布的数据为准。

注意事项

使用ChatGPT进行答案匹配需要OpenAI API密钥,会产生一定的调用成本;数据集中的图片版权归属于原始来源,仅限研究用途;评测你的模型时,务必使用与官方一致的系统提示词和推理参数,否则结果不具可比性。

四、内容与资源质量

MMBench的数据集规模约3000道多选题,相比早期的多模态评测基准(如VQA v2的数十万题量)不算大,但胜在维度划分精细、标注质量高。题目来源于公开数据集和人工筛选,每一道题都经过多轮校验以确保正确答案无歧义。

从更新频率看,MMBench自2023年发布论文(arXiv:2307.06281)以来,经历了多次版本迭代和排行榜更新,但核心评测逻辑保持稳定。所有数据、代码和论文均以开源形式发布在GitHub上,遵循学术研究友好的使用许可。版权方面,数据集本身由学术机构整理,图片素材来自已有公开数据集,使用者需自行注意原始图片的版权约束。

与同类基准(如SEED-Bench、MM-Vet、MMMU)相比,MMBench的差异化优势在于循环评测的稳定性和答案匹配的容错性,这两点被后续不少评测工作引用和借鉴。

五、适用人群与场景

适合人群

第一种是从事多模态模型研发的研究者和工程师,他们需要一个可靠的基准来横向对比自己的模型与业界水平。第二种是关注VLM能力边界的学术研究人员,MMBench的分维度得分有助于分析模型的具体失败模式。第三种是企业在选型开源多模态模型时的评估参考。

典型使用场景

场景一:某团队训练了一个新的视觉语言模型,将其在MMBench上跑分,发现”关系推理”维度得分明显偏低,于是针对性地补充了推理类训练数据。场景二:研究生撰写多模态综述论文时,引用MMBench的循环评测结果来说明不同模型的稳健性差异。场景三:企业技术选型时,通过对比候选模型在MMBench各维度的得分分布,选择更符合业务需求(如偏重文字识别而非物体定位)的模型。

不适合人群

普通网民或非技术背景的用户不适合直接使用MMBench——它不是一个面向消费者的应用,没有图形化的在线试用入口(评测服务也已停止),需要一定的编程能力才能跑通评测流程。

六、优缺点分析

优点

  • 循环评测设计有效抑制了随机猜测带来的虚高分数,结果更加稳健可信。
  • ChatGPT辅助的答案匹配大幅降低了对模型输出格式的依赖,减少了误判。
  • 20余个细粒度维度提供了丰富的模型能力画像,而非单一总分。
  • 完全开源,数据集和代码均可免费获取,学术可复现性高。

缺点

  • 在线评测服务已宣布停止,排行榜不再更新,对新模型的持续跟踪能力丧失。
  • 数据集规模约3000题,覆盖的场景相对有限,难以反映模型在开放域任务上的表现。
  • 使用ChatGPT做答案匹配引入了外部依赖,评测成本和对OpenAI服务的稳定性要求较高。
对比项MMBenchSEED-BenchMM-Vet
题目数量约3000约19000约200
评测方式循环多选题单选题开放式问答+GPT评分
维度数量20+126大能力
在线服务已停止可用可用
主要优势稳健性高规模大开放性强

综合来看,MMBench在多模态模型评测领域具有开创性贡献,其循环评测和答案匹配方法已被广泛认可。但服务停止后,它更适合作为历史基准和论文引用对象,活跃的在线评测需求需转向MM-Vet、MMMU等仍在维护的替代平台。

数据统计

数据评估

MMBench浏览人数已经达到15,如你需要查询该站的相关权重信息,可以点击"5118数据""爱站数据""Chinaz数据"进入;以目前的网站数据参考,建议大家请以爱站数据为准,更多网站价值评估因素如:MMBench的访问速度、搜索引擎收录以及索引量、用户体验等;当然要评估一个站的价值,最主要还是需要根据您自身的需求以及需要,一些确切的数据则需要找MMBench的站长进行洽谈提供。如该站的IP、PV、跳出率等!

关于MMBench特别声明

本站米吧导航提供的MMBench都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由米吧导航实际控制,在2026年9月12日 19:25收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,米吧导航不承担任何责任。

常见问题

1. MMBench 是做什么的?

MMBench 是一个多模态模型评测基准,主要考察模型的感知和推理能力。它用约 3000 道选择题覆盖目标检测、文字识别、动作识别、图像描述、关系推理等 20 多个细分维度,用来评估模型是不是一个全面的选手。

2. MMBench 数据集包含多少题目?

首页提到大约有 3000 道选择题,评测维度比较细,包括目标检测、文字识别、动作识别、图像描述、关系推理等,一共 20 多个方向。具体题型和划分可以看 Documentation。

3. 什么是 Circular Evaluation?

Circular Evaluation 是 MMBench 用来提高评测可靠性的一种做法:同一道多选题会把选项顺序打乱后重复多次,模型每次都能给出相同答案才算通过。相比传统一次性评测,平均准确率通常会下降 10% 到 20%,目的是减少噪声、让结果更容易复现。

4. MMBench 数据集怎么下载和使用?

官网首页有 Download 入口,具体使用方式可以查看 Documentation(Docs)。下载地址和加载步骤以官方文档为准。

5. MMBench 在线评测和排行榜还在运行吗?

根据官网公告,MMBench 在线评测服务自 2026 年 3 月 31 日起停止运营,对应的排行榜也不再更新。需要最新信息可以访问官网 MMBench 了解详情,或联系 opencompass@pjlab.org.cn。

相关导航

暂无评论

none
暂无评论...