
一、网站概况
LLMEval(http://llmeval.com)是复旦大学NLP实验室推出的大语言模型综合评测研究项目网站。网站汇集了该实验室在AAAI、EMNLP、ACL等顶会及arXiv上发表的系列评测论文,并提供相应的排行榜、开源数据集和代码。截至目前,网站已展示59个已评测大模型的结果,LLMEval-Fair题库规模达220K道生成式评测题目,GitHub项目获得285+星标。网站定位为严谨、公平、全面的大语言模型评测框架,覆盖13+学科门类、医学AI及逻辑推理等垂直领域。
二、核心功能详解
论文与数据集展示:网站首页及“论文”板块集中展示LLMEval系列研究成果,包括LLMEval-Logic(中文逻辑推理评测)、LLMEval-Fair(鲁棒公平评测)和LLMEval-Med(医学评测)。每篇论文均提供arXiv链接、代码仓库和数据集入口,用户可快速获取原始资料。
排行榜:网站提供“排行榜”页面,展示59个已评测大模型在不同基准上的性能得分与排名。通过排行榜,用户可以直观比较GPT系列、Claude、文心一言等主流模型在13个学科、医学任务和逻辑推理上的表现,为选型提供参考。
开源资源与代码:LLMEval项目在GitHub上开源,例如LLMEval-Logic已发布196道Base题、154道对抗强化Hard题、经Z3求解器验证的答案及专家rubric。用户可下载数据集并复现评测流水线,自行测试自己的模型。
博客与动态:网站的“博客”板块跟踪评测领域最新进展,发布研究解读、评测方法讨论等内容,帮助研究者了解前沿动态。
三、使用教程/操作指南
- 无需注册:LLMEval网站完全公开,访问即可浏览全部内容,无需注册登录。
- 浏览论文:点击首页“精选研究”或顶部“论文”菜单,阅读论文摘要;点击“arXiv”下载预印本,“Code”进入GitHub代码库,“Dataset”获取数据集文件。
- 查看排行榜:点击“排行榜”菜单,选择感兴趣的评测基准(如LLMEval-Fair、LLMEval-Med),查看各模型排名和具体得分。
- 下载开源数据集:进入GitHub仓库(页面提供链接),按照README说明下载数据集。例如LLMEval-Logic的题目、答案和rubric均以结构化文件提供,可直接用于本地评测。
- 参与评测或合作:如需获取私有抗污染测试集(如LLMEval-Fair的20%私有题目),可通过页面提供的邮箱(mingzhang23@m.fudan.edu.cn)或微信联系作者,申请合作评测。
- 小技巧:论文详情页通常标有“contamination-resistant”标签,表示该基准包含抗污染设计,适合用于严谨的模型能力验证;博客中偶尔会发布排行榜更新解读。
注意:部分数据集使用需遵守开源许可和引用要求,请在论文中正确引用对应文献。
四、内容与资源质量
LLMEval网站内容全部为复旦大学NLP实验室原创研究成果,非盗版或转载。资源更新频率与论文发表同步:现有三项主要基准分别发表于EMNLP 2025 Findings(LLMEval-Med)、ACL 2026(LLMEval-Fair)和arXiv 2026(LLMEval-Logic),均为最新成果。数据集质量经过多重验证:LLMEval-Logic的题目经Z3求解器验证、专家rubric审计,并通过对抗强化Agent淘汰简单样本;LLMEval-Fair使用22万道研究生级别私有题库,动态抽取测试集,LLM-as-a-judge与人类专家一致率达90%;LLMEval-Med包含2996道经医生验证的真实临床场景题目。资源数量可观:59个模型评测结果、220K题目、285+星标。版权方面,开源部分托管于GitHub,遵循开源协议;私有抗污染测试集保留在实验室内部,用于公平评测。
五、适用人群与场景
适合人群:大语言模型研究者、NLP方向学生、AI评测工程师、需要为业务选型模型的企业技术团队。
不适合人群:普通用户或非技术背景的AI爱好者,该网站不提供在线聊天或API试用,内容偏学术和评测。
典型场景举例:
1. 研究者开发了一个新的大模型,希望获得严谨、抗污染的评测结果,可下载LLMEval-Logic数据集,在本地运行评测,与已发布的59个模型对比。
2. 医学AI团队需要验证模型在真实临床任务上的能力,使用LLMEval-Med数据集进行医生验证的基准测试。
3. 学生或开发者想了解当前主流大模型在各学科(如数学、物理、医学)上的表现,直接查看排行榜和对应论文。
六、优缺点分析
优点:
– 学术权威性强:出自复旦大学NLP实验室,论文发表于顶会,方法论严谨。
– 抗污染设计:私有测试集和动态抽题有效避免数据泄露,评测结果更可信。
– 开源可复现:提供数据集、代码和评测流水线,便于研究者验证和扩展。
– 领域覆盖广:涵盖通识学科、医学、逻辑推理,且Hard子集难度高,为前沿模型留出挑战空间。
不足:
– 部分数据不公开:20%私有抗污染测试集需联系作者才能获取,普通用户无法直接评测。
– 缺少在线评测接口:用户需自行下载数据集、搭建评测环境,使用门槛相对较高。
– 更新节奏依赖论文发表:相比持续更新的商业榜单,网站内容更新不频繁。
与同类竞品对比:
| 特性 | LLMEval | OpenCompass | MMLU / C-Eval |
|---|---|---|---|
| 抗污染设计 | 强(私有测试集) | 中 | 弱(静态题库) |
| 医学/逻辑垂直领域 | 有专门基准 | 部分支持 | 无 |
| 开源程度 | 部分开源 | 完全开源 | 完全开源 |
| 在线评测 | 无 | 有 | 无 |
总体来看,LLMEval更适合追求严谨、公平评测的研究场景,而非快速选型或日常对比。
数据统计
数据评估
本站米吧导航提供的LLMEval3都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由米吧导航实际控制,在2026年9月12日 19:34收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,米吧导航不承担任何责任。
常见问题
1. LLMEval 是做什么的?
这是复旦大学NLP实验室推出的一个大语言模型评测项目官网,主要是发布评测论文、排行榜和博客。内容覆盖13+学科门类、医学AI,还有22万+生成式评测题目,用来衡量大模型的能力。
2. 目前有哪些评测基准?
首页主要介绍了三个:LLMEval-Logic 做中文逻辑推理,LLMEval-Fair 研究评测的鲁棒性和公平性,LLMEval-Med 针对真实临床场景的医学评测。分别发表在 arXiv 2026、ACL 2026 和 EMNLP 2025,具体论文信息可以在“论文”页查看。
3. 代码和数据是开源的吗?去哪下载?
LLMEval-Logic 已经开源,包含196道 Base 题、154道 Hard 题、Z3 验证答案和可复现的评测流水线。首页有 GitHub 仓库和数据集入口,点进去就能下载。
4. 排行榜在哪里看?
首页顶部有“排行榜”入口,点进去可以看到已经评测过的大模型表现。目前官网显示已经评测了59个大模型。
5. 想参与评测或合作,怎么联系?
可以发邮件到 mingzhang23@m.fudan.edu.cn,或者加微信 zanyingluan。想看代码和数据,也可以直接访问首页的 GitHub 组织链接。
相关导航


SuperCLUE

HELM

jenni

AGI-Eval

MMBench





