欢迎入驻!

OpenCompass

3天前更新 20 00

提供大语言模型第三方评测榜单、在线评测工具和评测数据集社区服务。

收录时间:
2026-09-12
OpenCompassOpenCompass

一、网站概况

OpenCompass 是由上海人工智能实验室推出的开源大模型评测体系,其官方评测榜单页面于 2023 年上线,是国内较早建立标准化大模型评测基准的平台之一。网站围绕大语言模型的能力评估展开,同时覆盖科学智能评测、具身智能评测、安全评测、AI 计算系统评测以及垂类领域评测等多个方向。

平台定位为第三方中立评测机构,核心服务包括公开评测榜单发布、评测数据集社区运营、在线评测工具提供以及评测规则制定。截至 2026 年,该榜单已收录国内外主流大模型数百个版本的评测结果,是国内开发者、研究机构和企业选型大模型时常用的参考来源之一。

二、核心功能详解

官方自建榜单 是网站最核心的功能。榜单基于官方闭源评测集,对各大模型进行统一维度的打分和排名。用户可以按月份查看历史榜单,观察模型能力的动态变化趋势。榜单默认展示综合得分,也支持按语言理解、推理能力、数学能力、代码能力等子维度分别排序,方便有特定需求的用户快速筛选。

在线评测功能 允许用户提交自己的模型进行测试。通过接入 OpenCompass 的评测框架,用户可以自定义评测集或使用官方公开评测集,获得标准化的评测报告。这一功能对高校研究团队和小型模型开发团队尤其是比较友好,因为无需自建评测环境即可获得与官方榜单同口径的对比数据。

评测集社区 是一个用户共建的开放平台。用户可以浏览其他研究者上传的评测数据集,也可以贡献自己的评测集参与年度评选。社区内支持按任务类型、语言、难度等标签筛选数据集,并展示每个数据集的使用次数和被引用情况,形成良性的生态循环。

三、使用教程/操作指南

第一步:浏览榜单。 无需注册即可访问榜单页面,通过顶部导航栏切换到“大模型竞技场”或“官方自建榜单”查看当前排名。建议先阅读“榜单规则”页面,了解评分体系和权重分配,避免误读排名含义。

第二步:筛选与对比。 在榜单页使用维度筛选器,选择关注的能力方向(如推理或代码)。点击具体模型名称可展开详细分项得分,部分模型支持横向对比,最多可同时勾选 3 个模型并排查看。

第三步:提交自评模型。 点击“在线评测”入口,使用手机号或邮箱注册账号。上传模型 API 接口信息后,选择评测集类型并配置评测参数,系统会自动排队执行评测任务。评测完成后,结果报告会通过站内信和邮件通知,用户可以选择是否公开结果。

注意事项: 官方闭源评测集的完整题目不对公众开放,用户只能看到得分和排名,这是为了防止评测集被训练数据污染。若想复现评测流程,可使用社区中公开的评测集替代。

四、内容与资源质量

OpenCompass 榜单的评测集分为官方闭源集和社区公开集两部分。官方闭源集由上海人工智能实验室维护,不对外公开题目内容,仅在榜单中展示得分,有效降低了模型“刷榜”和数据污染的风险。榜单每月更新一次,遇到重大模型发布时也会加开临时评测批次。

社区公开评测集数量持续增长,目前已涵盖数学、代码、推理、安全、多模态等多个类别。平台对上传的评测集有基本的格式审核和去重检查,但不对题目质量做强制学术评审,因此社区资源质量存在一定波动,使用时需自行判断适用性。

五、适用人群与场景

适合以下人群:

  • 企业技术选型人员: 需要横向对比多个大模型能力时,榜单提供统一的评测口径,节省逐一测试的时间成本。
  • 高校和科研团队: 可以借助平台的评测框架和公开数据集,快速完成论文实验对比,降低搭建评测环境的工作量。
  • 模型开发者: 通过提交自评模型获得官方同口径得分,便于定位模型短板。

不适合以下人群:

  • 追求完全透明评测的用户,因为官方闭源集不公开题目,无法独立验证评测过程。
  • 需要个性化业务场景评测的用户,榜单的通用能力评分不能替代自己业务数据上的实测。

典型使用场景举例:

  1. 某创业团队在多个候选基座模型间犹豫,登录榜单查看这些模型在数学和代码分项的排名后做出初步筛选。
  2. 一位研究生需要在论文中对比自研模型与主流模型的表现,使用平台在线评测功能获得标准化分数。
  3. 某企业安全部门查阅安全评测榜单,快速了解各模型在安全对齐方面的表现差异。

六、优缺点分析

优点:

  • 评测维度全面,覆盖通用能力与多个垂类方向,不只是单一的综合排名。
  • 官方闭源评测集有效降低数据污染导致的分数虚高,结果相对可信。
  • 免费开放给公众使用,无需付费即可查看榜单和大部分功能。
  • 社区生态活跃,用户可贡献评测集形成正向循环。

缺点:

  • 闭源评测集不公开题目,评测过程的复现性受限。
  • 部分评测任务的题量和覆盖范围相对有限,与个别商业评测机构相比维度颗粒度略粗。
  • 注册和提交评测的流程有一定技术门槛,非技术背景用户几乎无法使用在线评测功能。
对比维度OpenCompass国外某知名榜单
评测集透明度部分闭源公开
中文模型覆盖较全一般
使用门槛中等较低
自定义评测支持部分支持

数据统计

数据评估

OpenCompass浏览人数已经达到20,如你需要查询该站的相关权重信息,可以点击"5118数据""爱站数据""Chinaz数据"进入;以目前的网站数据参考,建议大家请以爱站数据为准,更多网站价值评估因素如:OpenCompass的访问速度、搜索引擎收录以及索引量、用户体验等;当然要评估一个站的价值,最主要还是需要根据您自身的需求以及需要,一些确切的数据则需要找OpenCompass的站长进行洽谈提供。如该站的IP、PV、跳出率等!

关于OpenCompass特别声明

本站米吧导航提供的OpenCompass都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由米吧导航实际控制,在2026年9月12日 19:54收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,米吧导航不承担任何责任。

常见问题

1. OpenCompass 是做什么的?

OpenCompass(司南)是一个大模型评测平台,页面上展示的是大语言模型官方自建榜单,按综合评分以及知识、推理、数学、代码几个维度给模型排名。除了大语言模型,还覆盖科学智能评测、具身智能评测、安全评测等方向。

2. 榜单多久更新一次?

当前页面展示的是 26 年 07 月榜,模型信息里也标注了各自的发布日期。更新频率页面没有直接写,建议直接访问 OpenCompass 官网留意最新一期榜单。

3. 榜单里的分数是怎么评出来的?

榜单基于 OpenCompass2.0 进行评测,综合评分会拆成知识、推理、数学、代码四个维度。具体维度权重和计算方式可以点击页面上的“榜单规则”查看。

4. 引用这个榜单的数据要怎么标注?

如果在写论文、新闻稿或自媒体文章时用到榜单数据,需要注明数据来源于司南官网平台 https://opencompass.org.cn。这是官方给出的引用要求。

5. 开源评测集榜单在哪里看?

OpenCompass1.0 的开源评测集榜单因为内容升级已经下架了,最新的开源评测集榜单放在“大语言模型公开学术榜单”里。你可以从页面导航找到对应入口查看。

相关导航

暂无评论

none
暂无评论...