
一、网站概况
AGI-Eval是一个面向大语言模型与多模态模型的专业评测平台,由高校与产业机构联合共建,合作方包括上海交通大学、同济大学、华东师范大学、美团及Datawhale等。平台提供模型能力排名榜单、评测数据集、人机竞赛、Data Studio数据贡献等功能,致力于通过通用评测方案帮助用户了解不同模型的优劣。目前活跃用户超过20000人,并持续收集多领域评测数据。平台已完成ICP备案,内容由官方与用户共同维护。
二、核心功能详解
模型榜单是平台最核心的功能,分大语言模型榜单和多模态模型榜单,并可筛选精调模型与基座模型。榜单展示模型名称、所属公司、开源/闭源属性及综合得分,部分榜单可进一步查看各能力项得分。以首页为例,GPT-5.5以0.8614分暂列第一,Claude-Fable-5、Gemini-3.1-Pro-Preview等紧随其后,帮助用户直观比较模型能力。
人机竞赛是平台的特色功能,用户可参与人机协同评测任务,与大模型协作完成特定题目或场景。平台宣称参与者既能体验前沿技术,也有机会参与评测方案共建并获得一定回报,适合希望深入了解模型边界的用户。
评测集模块分为平台官方与用户自建两类。官方评测集覆盖代码、推理、知识等多个领域,如“OI Bench Preview”包含NOIP、省选、NOI三个难度档次的算法竞赛题,由高校合作建设,共296条数据。用户也可贡献自建评测集,经审核后供他人使用。
Data Studio用于个人贡献专业领域数据,支持单条数据、扩写数据、Arena数据等多种收集方式,已有500多个任务标签,并通过机审加人审的多重机制保证数据质量。
三、使用教程/操作指南
- 查看榜单:进入首页后点击“查看榜单”或“查看完整榜单”,可按大语言模型/多模态模型、精调/基座等条件筛选,点击模型可查看详细能力得分。无需注册即可浏览榜单。
- 参与人机竞赛:点击“参与竞赛”,根据提示注册或登录平台。进入竞赛任务后,按题目要求与大模型协作完成作答或标注,提交结果等待审核反馈。
- 贡献评测集:点击“贡献评测集”或进入Data Studio,选择数据类型(单条、扩写、Arena等),填写问题、答案或标注内容,提交后经过机审和人审即可发布。
- 发起评测:首页“发起评测”允许用户创建自定义评测方案,适用于想针对特定维度测试模型的用户。
注意事项:提交的评测数据需符合平台规范,建议先阅读对应任务说明;部分竞赛或高级功能可能需要账号权限,注意保护个人信息。
四、内容与资源质量
平台内容来源分为官方自建和用户贡献,官方评测集由上海交通大学等高校团队和专家参与建设,如翟广涛、张伟楠等教授提供学术支撑,质量较有保障。首页展示的“OI Bench Preview”是典型官方数据集,题目难度覆盖信息学竞赛从省赛到全国赛,标注清晰。用户自建评测集需经过机审加人审,降低低质和重复数据。平台声称定期更新榜单,但更新频率未在页面明示。从现有页面看,资源量尚可,活跃用户20000+,任务标签500+,但与国外大型评测社区相比,公开可复现的评测集规模仍有待观察。版权方面,平台ICP备案号为沪ICP备2024098885号-1,页脚标注©2025 AGI-Eval,说明内容归属清晰。
五、适用人群与场景
适合:
– 需要横向比较不同大模型能力的开发者、产品经理或企业选型人员,可通过榜单快速筛选。
– 人工智能研究人员、高校学生,可参与人机竞赛、贡献评测集,接触前沿评测方法。
– 想通过数据贡献获得回报或参与社区建设的个人。
不适合:只是想找聊天机器人或生成内容的普通用户;对模型技术细节无兴趣、只想简单体验AI的人群。
具体场景举例:
1. 某创业团队在多个闭源和开源模型间犹豫,查阅AGI-Eval榜单对比综合得分与代码能力,最终选择性价比更高的模型接入产品。
2. 高校实验室将自建的医疗问答评测集上传至平台,经过审核后供社区使用,并获得曝光。
3. 研究生报名人机竞赛,通过与大模型协作完成高难度推理任务,提升自己对模型局限性的理解。
六、优缺点分析
优点:
– 数据来源权威,有高校和知名机构参与建设,榜单透明度较高。
– 功能覆盖完整,榜单、评测集、竞赛、数据贡献形成闭环。
– 人机协同评测方案具有创新性,兼顾用户体验与数据生产。
– 审核机制严格,机审加人审保障了数据质量。
不足:
– 榜单以闭源模型为主,普通用户无法复现部分评测结果,可验证性受限。
– 公开可下载的评测集数量和更新频率尚未明确,资源规模可能不足。
– 面向专业用户,界面和概念对新手的引导较少,上手门槛略高。
– 人机竞赛和Data Studio的具体回报机制未在首页详细说明,可能影响用户参与意愿。
与同类竞品简单对比如下:
| 维度 | AGI-Eval | Open LLM Leaderboard | Chatbot Arena |
|---|---|---|---|
| 主要评测对象 | 大语言模型、多模态模型 | 开源大语言模型 | 聊天模型 |
| 数据来源 | 官方+用户贡献,高校共建 | 开源社区数据集 | 用户匿名投票 |
| 是否支持用户贡献 | 支持评测集和数据贡献 | 有限 | 通过投票间接参与 |
| 透明度/复现性 | 较高,但闭源模型偏多 | 高,完全开源可复现 | 高,基于真实交互 |
| 特色功能 | 人机竞赛、Data Studio | 开放排行榜 | 竞技场盲测 |
总体而言,AGI-Eval适合作为国内大模型选型和评测研究的参考平台,尤其在人机协同评测和领域数据贡献方面有差异化优势。
数据统计
数据评估
本站米吧导航提供的AGI-Eval都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由米吧导航实际控制,在2026年9月12日 19:30收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,米吧导航不承担任何责任。
常见问题
1. AGI-Eval是做什么的?
AGI-Eval 是一个大模型评测平台,首页提供大语言模型榜单、多模态模型榜单、评测集、人机竞赛和 Data Studio 等入口。你可以在这里查看模型的综合能力和各能力项得分,方便对比不同模型的表现。
2. 这个网站免费吗?
首页没有直接标出收费信息,榜单、评测集、Data Studio 等内容都可以直接访问。通常这类评测平台的基础浏览功能是公开的,但如果涉及会员、付费评测或数据贡献收益,具体规则建议访问 https://agi-eval.cn/home 或联系 agieval17@gmail.com 确认。
3. 榜单多久更新一次?
首页写明会定期更新榜单,但没有给出固定的更新频率。想了解最新的大语言模型排名和多模态模型排名,可以常回官网看,或者关注官方微信公众号 AGI-Eval。
4. 怎么参与人机评测?
在首页点击“参与人机评测”或“发起评测”,可以进入相关流程。平台介绍可以与大模型协作、共建下一代评测标准,并有机会获得一定收益,具体参与方式和收益规则建议以官网说明为准。
5. 评测集是什么?个人能贡献数据吗?
评测集分为平台官方和用户自建两类,比如首页展示的 OI Bench Preview 就是官方自建的高难度信息学算法竞赛题。首页的 Data Studio 显示支持个人贡献专业领域数据,并有 500+ 任务标签和机审、人审多重审核机制,想贡献可以到官网 Data Studio 了解具体操作。
相关导航


SuperCLUE
PubMedQA

MMBench

LLMEval3





