
一、网站概况
OpenCompass 是由上海人工智能实验室推出的开源大模型评测体系,其官方评测榜单页面于 2023 年上线,是国内较早建立标准化大模型评测基准的平台之一。网站围绕大语言模型的能力评估展开,同时覆盖科学智能评测、具身智能评测、安全评测、AI 计算系统评测以及垂类领域评测等多个方向。
平台定位为第三方中立评测机构,核心服务包括公开评测榜单发布、评测数据集社区运营、在线评测工具提供以及评测规则制定。截至 2026 年,该榜单已收录国内外主流大模型数百个版本的评测结果,是国内开发者、研究机构和企业选型大模型时常用的参考来源之一。
二、核心功能详解
官方自建榜单 是网站最核心的功能。榜单基于官方闭源评测集,对各大模型进行统一维度的打分和排名。用户可以按月份查看历史榜单,观察模型能力的动态变化趋势。榜单默认展示综合得分,也支持按语言理解、推理能力、数学能力、代码能力等子维度分别排序,方便有特定需求的用户快速筛选。
在线评测功能 允许用户提交自己的模型进行测试。通过接入 OpenCompass 的评测框架,用户可以自定义评测集或使用官方公开评测集,获得标准化的评测报告。这一功能对高校研究团队和小型模型开发团队尤其是比较友好,因为无需自建评测环境即可获得与官方榜单同口径的对比数据。
评测集社区 是一个用户共建的开放平台。用户可以浏览其他研究者上传的评测数据集,也可以贡献自己的评测集参与年度评选。社区内支持按任务类型、语言、难度等标签筛选数据集,并展示每个数据集的使用次数和被引用情况,形成良性的生态循环。
三、使用教程/操作指南
第一步:浏览榜单。 无需注册即可访问榜单页面,通过顶部导航栏切换到“大模型竞技场”或“官方自建榜单”查看当前排名。建议先阅读“榜单规则”页面,了解评分体系和权重分配,避免误读排名含义。
第二步:筛选与对比。 在榜单页使用维度筛选器,选择关注的能力方向(如推理或代码)。点击具体模型名称可展开详细分项得分,部分模型支持横向对比,最多可同时勾选 3 个模型并排查看。
第三步:提交自评模型。 点击“在线评测”入口,使用手机号或邮箱注册账号。上传模型 API 接口信息后,选择评测集类型并配置评测参数,系统会自动排队执行评测任务。评测完成后,结果报告会通过站内信和邮件通知,用户可以选择是否公开结果。
注意事项: 官方闭源评测集的完整题目不对公众开放,用户只能看到得分和排名,这是为了防止评测集被训练数据污染。若想复现评测流程,可使用社区中公开的评测集替代。
四、内容与资源质量
OpenCompass 榜单的评测集分为官方闭源集和社区公开集两部分。官方闭源集由上海人工智能实验室维护,不对外公开题目内容,仅在榜单中展示得分,有效降低了模型“刷榜”和数据污染的风险。榜单每月更新一次,遇到重大模型发布时也会加开临时评测批次。
社区公开评测集数量持续增长,目前已涵盖数学、代码、推理、安全、多模态等多个类别。平台对上传的评测集有基本的格式审核和去重检查,但不对题目质量做强制学术评审,因此社区资源质量存在一定波动,使用时需自行判断适用性。
五、适用人群与场景
适合以下人群:
- 企业技术选型人员: 需要横向对比多个大模型能力时,榜单提供统一的评测口径,节省逐一测试的时间成本。
- 高校和科研团队: 可以借助平台的评测框架和公开数据集,快速完成论文实验对比,降低搭建评测环境的工作量。
- 模型开发者: 通过提交自评模型获得官方同口径得分,便于定位模型短板。
不适合以下人群:
- 追求完全透明评测的用户,因为官方闭源集不公开题目,无法独立验证评测过程。
- 需要个性化业务场景评测的用户,榜单的通用能力评分不能替代自己业务数据上的实测。
典型使用场景举例:
- 某创业团队在多个候选基座模型间犹豫,登录榜单查看这些模型在数学和代码分项的排名后做出初步筛选。
- 一位研究生需要在论文中对比自研模型与主流模型的表现,使用平台在线评测功能获得标准化分数。
- 某企业安全部门查阅安全评测榜单,快速了解各模型在安全对齐方面的表现差异。
六、优缺点分析
优点:
- 评测维度全面,覆盖通用能力与多个垂类方向,不只是单一的综合排名。
- 官方闭源评测集有效降低数据污染导致的分数虚高,结果相对可信。
- 免费开放给公众使用,无需付费即可查看榜单和大部分功能。
- 社区生态活跃,用户可贡献评测集形成正向循环。
缺点:
- 闭源评测集不公开题目,评测过程的复现性受限。
- 部分评测任务的题量和覆盖范围相对有限,与个别商业评测机构相比维度颗粒度略粗。
- 注册和提交评测的流程有一定技术门槛,非技术背景用户几乎无法使用在线评测功能。
| 对比维度 | OpenCompass | 国外某知名榜单 |
|---|---|---|
| 评测集透明度 | 部分闭源 | 公开 |
| 中文模型覆盖 | 较全 | 一般 |
| 使用门槛 | 中等 | 较低 |
| 自定义评测 | 支持 | 部分支持 |
数据统计
数据评估
本站米吧导航提供的OpenCompass都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由米吧导航实际控制,在2026年9月12日 19:54收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,米吧导航不承担任何责任。
常见问题
1. OpenCompass 是做什么的?
OpenCompass(司南)是一个大模型评测平台,页面上展示的是大语言模型官方自建榜单,按综合评分以及知识、推理、数学、代码几个维度给模型排名。除了大语言模型,还覆盖科学智能评测、具身智能评测、安全评测等方向。
2. 榜单多久更新一次?
当前页面展示的是 26 年 07 月榜,模型信息里也标注了各自的发布日期。更新频率页面没有直接写,建议直接访问 OpenCompass 官网留意最新一期榜单。
3. 榜单里的分数是怎么评出来的?
榜单基于 OpenCompass2.0 进行评测,综合评分会拆成知识、推理、数学、代码四个维度。具体维度权重和计算方式可以点击页面上的“榜单规则”查看。
4. 引用这个榜单的数据要怎么标注?
如果在写论文、新闻稿或自媒体文章时用到榜单数据,需要注明数据来源于司南官网平台 https://opencompass.org.cn。这是官方给出的引用要求。
5. 开源评测集榜单在哪里看?
OpenCompass1.0 的开源评测集榜单因为内容升级已经下架了,最新的开源评测集榜单放在“大语言模型公开学术榜单”里。你可以从页面导航找到对应入口查看。
相关导航


BrainyAI

NewsDeck

觅知网

Speechki

Arvin AI

Clap





