公开基准与聚合榜单调研

调研日期:2026-08-13
问题:benchlm.ai / llm-stats.com 这类聚合榜单背后的基准数据集有多大?跑一遍需要多少时间和算力?


一句话结论

基准数据集小得出乎意料,算力几乎不是问题——真正的成本来自推理 token 和 agent 多轮,而不是数据量。

更值得注意的是第二点:这些聚合站大多不自己跑基准,而是抓取公开分数,而公开分数之间的可比性远比想象中差。


一、基准到底有多大

主流基准的规模

基准 题量 类型
AIME(单年) 30 数学竞赛,数值答案
CritPt 70 物理推理
Terminal-Bench v2.1 89 终端 agent 任务
𝜏³-Banking 97 工具调用 agent
AA-LCR 100 长上下文推理
ARC-AGI-2(公开评测集) ~120 视觉推理
HumanEval 164 Python 函数补全
GPQA Diamond 198 研究生级四选一
GDPval-AA v2 220 真实工作任务
SciCode 288 子问题 科研代码
SWE-bench Verified 500 真实 GitHub issue
MATH500 500 竞赛数学
LiveCodeBench v2 511 竞赛编程(滚动更新)
MBPP ~974 Python 基础题
GSM8K(测试集) 1,319 小学应用题
HLE 2,500 前沿学科难题
MATH(测试集) 5,000 竞赛数学
AA-Omniscience 6,000 知识+幻觉
MMLU-Pro 12,032 十选一
MMLU(测试集) 14,079 四选一

注意最上面那几行。 GPQA Diamond —— 被当作衡量前沿推理能力的主力基准之一 —— 只有 198 道题。AIME 只有 30 道。HumanEval 只有 164 道

一个对照:整个 Artificial Analysis 智能指数

AA 的 Intelligence Index v4.1.1 由 9 个评测组成,方法论页面公开了完整构成:

评测 类别 题量 重复次数 权重
GDPval-AA v2 Agents 220 1 20%
𝜏³-Banking Agents 97 5 14%
Terminal-Bench v2.1 Coding 89 3 16%
SciCode Coding 288 3 8%
AA-LCR General 100 3 6%
AA-Omniscience General 6,000 1 12%
HLE Scientific 2,158 1 12%
GPQA Diamond Scientific 198 5 6%
CritPt Scientific 70 5 6%

算上重复采样,整个指数一共约 11,600 次任务执行

作为对照:光一个 MMLU 测试集(14,079 题)就比整个 AA 指数还大。

存储

纯文本基准全是 JSON/JSONL,MB 量级,GitHub 或 HuggingFace 直接下载。GPQA Diamond 这种 198 题的文件只有几百 KB。

唯一存储占大头的是 SWE-bench 类——每个仓库要构建 Docker 环境(数十 GB 量级,属粗略估计)。但即便如此,也远不到需要专门集群的程度,一台开发机就能装下。


二、算力:一个常见的误解

评测是纯推理,不涉及任何训练。 如果通过 API 调用模型,你这边需要的 GPU 是零。算力开销全在服务商那边,你付的是 token 费。

Epoch AI 在 SWE-bench Verified 页面描述的环境是一个「最小 Linux Docker 容器、无网络访问」——判分侧跑在 CPU 上。瓶颈是 API 吞吐和 Docker 启动,不是本地算力。

只有一种情况需要自备 GPU:评测开源权重模型且自己部署推理。那是另一件事,成本结构完全不同。


三、真正的成本来自哪里

数据量小,但费用可以很高——因为成本不由题量决定,由三个别的因素决定。

驱动因素 1:推理 token

推理模型在一道题上可能烧掉几万 token 的思考过程。Epoch 对 SWE-bench Verified 的设定是每个任务上限 200 万 uncached token + 2000 万 cached 读取,并且在 2025 年 11 月把 FrontierMath 的 token 预算提高了 10 倍,原因是观察到模型频繁超限。

驱动因素 2:Agent 多轮

Agentic 基准里每个「任务」不是一次请求,而是一个多轮循环。SWE-bench 的一个任务可能是几十轮对话,且每轮都要重发完整历史,输入量呈二次增长(Epoch 明确指出了这一点)。

驱动因素 3:重复采样

看上表:GPQA Diamond、𝜏³-Banking、CritPt 都跑 5 次重复。198 道题实际是 990 次调用。

实测数字

普林斯顿 HAL 榜单公布了复现运行的真实 API 花费,SWE-bench Verified 全量 500 题

模型 得分 花费
claude-3-5-sonnet-20241022 38.00% $67.09
gpt-4o-2024-08-06 29.80% $79.84
o1-mini-2024-09-12 27.20% $366.81

注意 o1-mini:得分最低,花费却是前两者的 5 倍——这就是推理 token 的代价。

ARC Prize 榜单直接把「每任务成本」作为坐标轴之一:

方案 得分 每任务成本
Kaggle 冠军(4B 微调模型) 24% $0.20
GPT-5.2 (X-High) 52.9% $1.90
Opus 4.5 (Thinking 64k) 37.6% $2.20
Imbue 代码演化 + Gemini 3.1 Pro 95.1% $8.71
Gemini 3 Deep Think $13.62
精调方案(Poetiq) 54% $30
人类 ~100% ~$17

ARC-AGI-2 公开评测集约 120 题,按 $2–30/题算,单次全量运行 $240–3,600。这是最贵的那一档。

成本量级速查

基准 单次全量运行的量级
HumanEval / GSM8K / MATH500 几美元
GPQA Diamond(198 题 ×5 次) 十几到几十美元(推理模型可到数百)
MMLU / MMLU-Pro 几十美元(题多但每题输出短)
HLE(2,500 题,推理模型) 数百美元
SWE-bench Verified $67–367(实测),推理模型上千
ARC-AGI-2 数百到数千

一个关键观察:有分析指出,SWE-bench Verified 榜单上最后 7–15 分的提升,每输出 token 的代价要贵 20–50 倍

时间

瓶颈是限流和并发,不是算力。

粗算:一个 500 任务的 agentic 基准,每任务 20 轮 = 10,000 次 API 调用;4 并发、每次 10 秒 → 约 7 小时。提高并发就能线性缩短,直到撞上服务商的 rate limit。

纯问答类基准(MMLU 这种)在合理并发下几小时内可以跑完


四、聚合榜单是怎么来的:自己跑 vs 抓分数

这是我认为比「数据集多大」更重要的发现。

三家的做法完全不同

站点 分数来源 聚合方法
Artificial Analysis 自己跑 9 个评测按类别加权(Agents 34% / Coding 24% / Scientific 24% / General 18%)
llm-stats.com 混合,逐条标注 TrueSkill 竞技评分,公开分取 μ − 3σ 保守估计
benchlm.ai 抓取公开分数 BenchAlign 归一化 + 类别加权(Agentic 22%),另分「加权」与「仅展示」两类

llm-stats 的数据结构里每条分数都带 is_self_reported(是否厂商自报)、analysis_methodsource_link它的评分方法页说明:缺数据的模型不按 0 分处理,而是保留更大的不确定度 σ,因此被扣得更多——这个设计是合理的。

BenchLM 的方法论明确说「不同难度的测试之间绝不直接平均原始百分比」,并给每个基准打上版本、刷新频率、是否饱和的元数据。它的数据来自 OpenBench、厂商官方表格、模型卡、发布公告和各基准原生榜单。

可比性问题有多严重

这才是要点。公开分数之间的差异,很多不是模型差异,是测量条件差异

① 自报 vs 独立测量
调研中反复出现的数字:MMLU 上自报与独立测量相差 5 分是常态;SWE-bench 上几乎所有头条成绩都是自报,而单是 scaffold(脚手架)差异就能造成 28 分以上的落差

② 连题量都不一致
Epoch 在 SWE-bench Verified 上跑 484 题(排除 16 个在其环境里跑不稳的样本),而它记录的其他方报告:GPT-5 用了 477 题,Claude 3.7 Sonnet 用了 489 题,Anthropic 后续版本用了全部 500 题

③ 同一模型,换个 harness 分数就变
Epoch 的 changelog 直白写着:2026-02-12 的 v2.0.0 脚手架/环境/token 上限升级「led to model performance improving significantly」。

也就是说,同一个模型、同一个基准、只是评测框架升级了,分数就显著变了。任何混用了升级前后数据的榜单,都在拿苹果比橘子。

④ zero-shot / few-shot 不统一
同一模型在同一基准上,zero-shot 和 few-shot 的分数可以差很多,而多数榜单不一致地混报两者。

⑤ 等权重掩盖样本量差异
有分析指出:GPQA Diamond 只有 198 题、MMLU 有 14,079 题,但聚合时等权重对待——198 题的分数,其统计噪声远大于 14,079 题的,等权重等于放大了噪声。

一个自相矛盾的地方

llm-stats 的公开基准页宣称所有分数都是「independently verified」,但其数据结构里明确存在 is_self_reported 字段。页面级的宣称和数据级的事实对不上

如果要用它的数据,建议直接读 JSON 仓库而不是渲染后的榜单,并按 is_self_reportedanalysis_method 分层看。


五、对我们自己这套工具的启示

1. 我们的题库规模完全够用

04_eval_engine/banks/core.jsonl85 题。对照上表:

  • GPQA Diamond:198 题
  • HumanEval:164 题
  • AIME:30 题

我们的题库和主流基准是同一个量级,不需要为「题太少」焦虑。真正要担心的从来不是题量,而是区分度——这正是 01/analysis.py items 用 IRT 在解决的问题。

2. 跑一遍的成本可以精确估算

83 题 × 3 次采样 = 249 次请求

模型类型 估算输出 token 估算成本
非推理模型(~500 tok/题) ~12.5 万 $2 上下
推理模型(~5,000 tok/题) ~125 万 $20 上下

全量跑一次的量级是几美元到几十美元。 这个数字意味着:按周监控完全负担得起,怀疑有差异时把 --trials 调到 10 也只是三倍成本。

3. 我们做对的几件事,恰好是聚合榜单做不到的

聚合榜单的问题 我们的对策
混用自报与独立测量 全部自己跑,同一 harness
题量不一致(477/484/489/500) 题库冻结,bank.py 校验题号唯一性
harness 升级导致分数变化 判分器与题库同库版本管理
点估计不带不确定性 所有通过率配 Wilson 95% 区间
等权重放大小样本噪声 维度权重可配,且 analysis.py 会标出无区分度的题
单次采样 trials < 3 直接警告
条件不一致(思考模式/联网/渠道) 写进 config.meta 备查,README 列为硬约束

4. 值得借鉴的两点

① 把成本作为一等指标。 ARC Prize 把「每任务成本」直接做成坐标轴,AA 把「Cost per Task」「Tokens per Task」列进方法论。我们的引擎已经记录了延迟和 token,但没有把成本做进报告——建议在 config 里加单价,report.md 里出「每题成本」和「质量/成本前沿」。

② 保守估计而非点估计。 llm-stats 用 μ − 3σ 作为公开分,缺数据的模型被自动扣分。这个思路比我们现在的「加权平均」更稳健,值得在总评分里考虑——尤其是当某些维度题量很少时。


六、直接回答最初的问题

基准数据集大吗?
不大。绝大多数是几百到一万条文本,MB 量级。GPQA Diamond 198 题、HumanEval 164 题、AIME 30 题。整个 AA 智能指数算上重复也只有约 11,600 次任务执行,比单个 MMLU 还小。

需要很久吗?
纯问答基准几小时;agentic 基准(SWE-bench 类)因为多轮和 Docker 启动,可能跑一整天。瓶颈是 API 限流和并发,不是算力。

需要很大算力吗?
用 API 的话完全不需要 GPU。 判分侧跑在 CPU 上。只有自己部署开源模型时才需要推理卡。

那为什么有的评测很贵?
成本不由题量决定,由三件事决定:推理 token 用量(o1-mini 在 SWE-bench 上得分最低却花了 $367)、agent 多轮的历史重发(输入呈二次增长)、重复采样次数(AA 对 GPQA 跑 5 次)。

最该注意的是什么?
不是成本,是可比性。这些聚合榜单的分数来自不同 harness、不同题量、不同 shot 设定、部分是厂商自报。已知的落差:MMLU 自报 vs 独立测量常差 5 分,SWE-bench 的 scaffold 差异可超 28 分,Epoch 自己的脚手架升级就让分数「显著提升」。

把这些数字加权平均成一个综合排名,数学上做得再精巧,也无法消除底层测量条件的不一致。 这正是为什么自建私有题库、固定测量条件仍然有不可替代的价值——不是为了比公开榜单更准,而是为了让你自己的历史数据之间可比


参考来源

数字可信度提示:AA 方法论、Epoch、HAL、ARC Prize 属一手来源,数字可靠。
部分聚合站与营销向页面的具体分数和价格为二手,已在文中标注为「量级估计」。
各站数据持续更新,本文数字为 2026-08 快照。