基准与聚合榜单调研
公开基准与聚合榜单调研
调研日期:2026-08-13
问题:benchlm.ai / llm-stats.com 这类聚合榜单背后的基准数据集有多大?跑一遍需要多少时间和算力?
一句话结论
基准数据集小得出乎意料,算力几乎不是问题——真正的成本来自推理 token 和 agent 多轮,而不是数据量。
更值得注意的是第二点:这些聚合站大多不自己跑基准,而是抓取公开分数,而公开分数之间的可比性远比想象中差。
一、基准到底有多大
主流基准的规模
| 基准 | 题量 | 类型 |
|---|---|---|
| AIME(单年) | 30 | 数学竞赛,数值答案 |
| CritPt | 70 | 物理推理 |
| Terminal-Bench v2.1 | 89 | 终端 agent 任务 |
| 𝜏³-Banking | 97 | 工具调用 agent |
| AA-LCR | 100 | 长上下文推理 |
| ARC-AGI-2(公开评测集) | ~120 | 视觉推理 |
| HumanEval | 164 | Python 函数补全 |
| GPQA Diamond | 198 | 研究生级四选一 |
| GDPval-AA v2 | 220 | 真实工作任务 |
| SciCode | 288 子问题 | 科研代码 |
| SWE-bench Verified | 500 | 真实 GitHub issue |
| MATH500 | 500 | 竞赛数学 |
| LiveCodeBench v2 | 511 | 竞赛编程(滚动更新) |
| MBPP | ~974 | Python 基础题 |
| GSM8K(测试集) | 1,319 | 小学应用题 |
| HLE | 2,500 | 前沿学科难题 |
| MATH(测试集) | 5,000 | 竞赛数学 |
| AA-Omniscience | 6,000 | 知识+幻觉 |
| MMLU-Pro | 12,032 | 十选一 |
| MMLU(测试集) | 14,079 | 四选一 |
注意最上面那几行。 GPQA Diamond —— 被当作衡量前沿推理能力的主力基准之一 —— 只有 198 道题。AIME 只有 30 道。HumanEval 只有 164 道。
一个对照:整个 Artificial Analysis 智能指数
AA 的 Intelligence Index v4.1.1 由 9 个评测组成,方法论页面公开了完整构成:
| 评测 | 类别 | 题量 | 重复次数 | 权重 |
|---|---|---|---|---|
| GDPval-AA v2 | Agents | 220 | 1 | 20% |
| 𝜏³-Banking | Agents | 97 | 5 | 14% |
| Terminal-Bench v2.1 | Coding | 89 | 3 | 16% |
| SciCode | Coding | 288 | 3 | 8% |
| AA-LCR | General | 100 | 3 | 6% |
| AA-Omniscience | General | 6,000 | 1 | 12% |
| HLE | Scientific | 2,158 | 1 | 12% |
| GPQA Diamond | Scientific | 198 | 5 | 6% |
| CritPt | Scientific | 70 | 5 | 6% |
算上重复采样,整个指数一共约 11,600 次任务执行。
作为对照:光一个 MMLU 测试集(14,079 题)就比整个 AA 指数还大。
存储
纯文本基准全是 JSON/JSONL,MB 量级,GitHub 或 HuggingFace 直接下载。GPQA Diamond 这种 198 题的文件只有几百 KB。
唯一存储占大头的是 SWE-bench 类——每个仓库要构建 Docker 环境(数十 GB 量级,属粗略估计)。但即便如此,也远不到需要专门集群的程度,一台开发机就能装下。
二、算力:一个常见的误解
评测是纯推理,不涉及任何训练。 如果通过 API 调用模型,你这边需要的 GPU 是零。算力开销全在服务商那边,你付的是 token 费。
Epoch AI 在 SWE-bench Verified 页面描述的环境是一个「最小 Linux Docker 容器、无网络访问」——判分侧跑在 CPU 上。瓶颈是 API 吞吐和 Docker 启动,不是本地算力。
只有一种情况需要自备 GPU:评测开源权重模型且自己部署推理。那是另一件事,成本结构完全不同。
三、真正的成本来自哪里
数据量小,但费用可以很高——因为成本不由题量决定,由三个别的因素决定。
驱动因素 1:推理 token
推理模型在一道题上可能烧掉几万 token 的思考过程。Epoch 对 SWE-bench Verified 的设定是每个任务上限 200 万 uncached token + 2000 万 cached 读取,并且在 2025 年 11 月把 FrontierMath 的 token 预算提高了 10 倍,原因是观察到模型频繁超限。
驱动因素 2:Agent 多轮
Agentic 基准里每个「任务」不是一次请求,而是一个多轮循环。SWE-bench 的一个任务可能是几十轮对话,且每轮都要重发完整历史,输入量呈二次增长(Epoch 明确指出了这一点)。
驱动因素 3:重复采样
看上表:GPQA Diamond、𝜏³-Banking、CritPt 都跑 5 次重复。198 道题实际是 990 次调用。
实测数字
普林斯顿 HAL 榜单公布了复现运行的真实 API 花费,SWE-bench Verified 全量 500 题:
| 模型 | 得分 | 花费 |
|---|---|---|
| claude-3-5-sonnet-20241022 | 38.00% | $67.09 |
| gpt-4o-2024-08-06 | 29.80% | $79.84 |
| o1-mini-2024-09-12 | 27.20% | $366.81 |
注意 o1-mini:得分最低,花费却是前两者的 5 倍——这就是推理 token 的代价。
ARC Prize 榜单直接把「每任务成本」作为坐标轴之一:
| 方案 | 得分 | 每任务成本 |
|---|---|---|
| Kaggle 冠军(4B 微调模型) | 24% | $0.20 |
| GPT-5.2 (X-High) | 52.9% | $1.90 |
| Opus 4.5 (Thinking 64k) | 37.6% | $2.20 |
| Imbue 代码演化 + Gemini 3.1 Pro | 95.1% | $8.71 |
| Gemini 3 Deep Think | — | $13.62 |
| 精调方案(Poetiq) | 54% | $30 |
| 人类 | ~100% | ~$17 |
ARC-AGI-2 公开评测集约 120 题,按 $2–30/题算,单次全量运行 $240–3,600。这是最贵的那一档。
成本量级速查
| 基准 | 单次全量运行的量级 |
|---|---|
| HumanEval / GSM8K / MATH500 | 几美元 |
| GPQA Diamond(198 题 ×5 次) | 十几到几十美元(推理模型可到数百) |
| MMLU / MMLU-Pro | 几十美元(题多但每题输出短) |
| HLE(2,500 题,推理模型) | 数百美元 |
| SWE-bench Verified | $67–367(实测),推理模型上千 |
| ARC-AGI-2 | 数百到数千 |
一个关键观察:有分析指出,SWE-bench Verified 榜单上最后 7–15 分的提升,每输出 token 的代价要贵 20–50 倍。
时间
瓶颈是限流和并发,不是算力。
粗算:一个 500 任务的 agentic 基准,每任务 20 轮 = 10,000 次 API 调用;4 并发、每次 10 秒 → 约 7 小时。提高并发就能线性缩短,直到撞上服务商的 rate limit。
纯问答类基准(MMLU 这种)在合理并发下几小时内可以跑完。
四、聚合榜单是怎么来的:自己跑 vs 抓分数
这是我认为比「数据集多大」更重要的发现。
三家的做法完全不同
| 站点 | 分数来源 | 聚合方法 |
|---|---|---|
| Artificial Analysis | 自己跑 | 9 个评测按类别加权(Agents 34% / Coding 24% / Scientific 24% / General 18%) |
| llm-stats.com | 混合,逐条标注 | TrueSkill 竞技评分,公开分取 μ − 3σ 保守估计 |
| benchlm.ai | 抓取公开分数 | BenchAlign 归一化 + 类别加权(Agentic 22%),另分「加权」与「仅展示」两类 |
llm-stats 的数据结构里每条分数都带 is_self_reported(是否厂商自报)、analysis_method、source_link。它的评分方法页说明:缺数据的模型不按 0 分处理,而是保留更大的不确定度 σ,因此被扣得更多——这个设计是合理的。
BenchLM 的方法论明确说「不同难度的测试之间绝不直接平均原始百分比」,并给每个基准打上版本、刷新频率、是否饱和的元数据。它的数据来自 OpenBench、厂商官方表格、模型卡、发布公告和各基准原生榜单。
可比性问题有多严重
这才是要点。公开分数之间的差异,很多不是模型差异,是测量条件差异:
① 自报 vs 独立测量
调研中反复出现的数字:MMLU 上自报与独立测量相差 5 分是常态;SWE-bench 上几乎所有头条成绩都是自报,而单是 scaffold(脚手架)差异就能造成 28 分以上的落差。
② 连题量都不一致
Epoch 在 SWE-bench Verified 上跑 484 题(排除 16 个在其环境里跑不稳的样本),而它记录的其他方报告:GPT-5 用了 477 题,Claude 3.7 Sonnet 用了 489 题,Anthropic 后续版本用了全部 500 题。
③ 同一模型,换个 harness 分数就变
Epoch 的 changelog 直白写着:2026-02-12 的 v2.0.0 脚手架/环境/token 上限升级「led to model performance improving significantly」。
也就是说,同一个模型、同一个基准、只是评测框架升级了,分数就显著变了。任何混用了升级前后数据的榜单,都在拿苹果比橘子。
④ zero-shot / few-shot 不统一
同一模型在同一基准上,zero-shot 和 few-shot 的分数可以差很多,而多数榜单不一致地混报两者。
⑤ 等权重掩盖样本量差异
有分析指出:GPQA Diamond 只有 198 题、MMLU 有 14,079 题,但聚合时等权重对待——198 题的分数,其统计噪声远大于 14,079 题的,等权重等于放大了噪声。
一个自相矛盾的地方
llm-stats 的公开基准页宣称所有分数都是「independently verified」,但其数据结构里明确存在 is_self_reported 字段。页面级的宣称和数据级的事实对不上。
如果要用它的数据,建议直接读 JSON 仓库而不是渲染后的榜单,并按 is_self_reported 和 analysis_method 分层看。
五、对我们自己这套工具的启示
1. 我们的题库规模完全够用
04_eval_engine/banks/core.jsonl 有 85 题。对照上表:
- GPQA Diamond:198 题
- HumanEval:164 题
- AIME:30 题
我们的题库和主流基准是同一个量级,不需要为「题太少」焦虑。真正要担心的从来不是题量,而是区分度——这正是 01/analysis.py items 用 IRT 在解决的问题。
2. 跑一遍的成本可以精确估算
83 题 × 3 次采样 = 249 次请求。
| 模型类型 | 估算输出 token | 估算成本 |
|---|---|---|
| 非推理模型(~500 tok/题) | ~12.5 万 | $2 上下 |
| 推理模型(~5,000 tok/题) | ~125 万 | $20 上下 |
全量跑一次的量级是几美元到几十美元。 这个数字意味着:按周监控完全负担得起,怀疑有差异时把 --trials 调到 10 也只是三倍成本。
3. 我们做对的几件事,恰好是聚合榜单做不到的
| 聚合榜单的问题 | 我们的对策 |
|---|---|
| 混用自报与独立测量 | 全部自己跑,同一 harness |
| 题量不一致(477/484/489/500) | 题库冻结,bank.py 校验题号唯一性 |
| harness 升级导致分数变化 | 判分器与题库同库版本管理 |
| 点估计不带不确定性 | 所有通过率配 Wilson 95% 区间 |
| 等权重放大小样本噪声 | 维度权重可配,且 analysis.py 会标出无区分度的题 |
| 单次采样 | trials < 3 直接警告 |
| 条件不一致(思考模式/联网/渠道) | 写进 config.meta 备查,README 列为硬约束 |
4. 值得借鉴的两点
① 把成本作为一等指标。 ARC Prize 把「每任务成本」直接做成坐标轴,AA 把「Cost per Task」「Tokens per Task」列进方法论。我们的引擎已经记录了延迟和 token,但没有把成本做进报告——建议在 config 里加单价,report.md 里出「每题成本」和「质量/成本前沿」。
② 保守估计而非点估计。 llm-stats 用 μ − 3σ 作为公开分,缺数据的模型被自动扣分。这个思路比我们现在的「加权平均」更稳健,值得在总评分里考虑——尤其是当某些维度题量很少时。
六、直接回答最初的问题
基准数据集大吗?
不大。绝大多数是几百到一万条文本,MB 量级。GPQA Diamond 198 题、HumanEval 164 题、AIME 30 题。整个 AA 智能指数算上重复也只有约 11,600 次任务执行,比单个 MMLU 还小。
需要很久吗?
纯问答基准几小时;agentic 基准(SWE-bench 类)因为多轮和 Docker 启动,可能跑一整天。瓶颈是 API 限流和并发,不是算力。
需要很大算力吗?
用 API 的话完全不需要 GPU。 判分侧跑在 CPU 上。只有自己部署开源模型时才需要推理卡。
那为什么有的评测很贵?
成本不由题量决定,由三件事决定:推理 token 用量(o1-mini 在 SWE-bench 上得分最低却花了 $367)、agent 多轮的历史重发(输入呈二次增长)、重复采样次数(AA 对 GPQA 跑 5 次)。
最该注意的是什么?
不是成本,是可比性。这些聚合榜单的分数来自不同 harness、不同题量、不同 shot 设定、部分是厂商自报。已知的落差:MMLU 自报 vs 独立测量常差 5 分,SWE-bench 的 scaffold 差异可超 28 分,Epoch 自己的脚手架升级就让分数「显著提升」。
把这些数字加权平均成一个综合排名,数学上做得再精巧,也无法消除底层测量条件的不一致。 这正是为什么自建私有题库、固定测量条件仍然有不可替代的价值——不是为了比公开榜单更准,而是为了让你自己的历史数据之间可比。
参考来源
- Artificial Analysis · Intelligence Benchmarking Methodology —— 指数构成、题量、重复次数、成本口径
- Epoch AI · SWE-bench Verified —— 484/500 题、token 上限、脚手架变更日志
- HAL Leaderboard · SWE-bench —— 复现运行的真实 API 花费
- ARC Prize · Leaderboard 与 2025 Results Analysis —— 每任务成本
- Imbue · Beating ARC-AGI-2 with Code Evolution —— 95.1% @ $8.71/task
- LLM Stats · Score Methodology —— TrueSkill 与 μ−3σ
- LLMStats 数据结构(DeepWiki) ——
is_self_reported字段 - BenchLM · Methodology —— BenchAlign 与类别权重
- GPQA 原论文 —— 448/546/198 三个子集
- Humanity’s Last Exam —— 2,500 题
- SWE-bench Verified 官方页
- The Price of Progress(arXiv 2026) —— 基准运行价格的系统性分析
- Evidently AI · 30 LLM evaluation benchmarks —— 各基准题量汇总
- SWE-bench Pro Leaderboard(morphllm) —— 最后 7–15 分的边际成本
数字可信度提示:AA 方法论、Epoch、HAL、ARC Prize 属一手来源,数字可靠。
部分聚合站与营销向页面的具体分数和价格为二手,已在文中标注为「量级估计」。
各站数据持续更新,本文数字为 2026-08 快照。



