BenchAtlas使用指南
BenchAtlas 使用手册

结合评测环境,正确理解 benchmark 分数。

BenchAtlas 将模型卡和技术报告中的 benchmark、模型分数与运行配置整理成可探索的地图。你可以用它查找公开报分、判断哪些结果可以比较,并查看每个数字背后的评测设置。

公开报分记录
基础模型
Benchmark family
来源报告

快速开始

一次可靠的比较通常分为四步:先找到 benchmark,再限定可比范围,最后检查配置和原始证据。

01

找到 benchmark

搜索 benchmark 或模型名称,按七个一级领域浏览,或者直接点击地图节点。

搜索 → 选择地图节点
02

选择协议分组

在右侧详情面板中选择 Evaluation protocol group。只有共享同一评测设置的记录才会一起排名。

可比排名 → 协议分组
03

检查运行配置

查看推理模式、上下文长度、工具、harness、judge、运行次数、聚合方式和数据集变体。

Method notes → 报分来源
04

打开原始证据

当某个分数将用于决策、文章或研究时,应继续打开原始报告并核对具体页码或表格位置。

Source evidence → 原始来源

数据如何分层

四个公开层级分别回答不同问题。能否进入地图只是展示规则,不构成新的数据实体。

01

Benchmark family

合并命名别名、metric 和有意义 variant 后的规范 Benchmark 身份。

个 family
02

Benchmark 结果分组

由规范 Benchmark、metric 和有意义的 variant 构成;每个分组对应一张结果页。

个结果分组
03

可比设置组

评测设置足够一致、可以直接放在一起排名的报分记录集合。

个可比组
04

公开报分

一个模型或配置在特定设置下的分数,并保留来源、证据位置和运行配置。

条报分

视图与操作

Landscape 地图

展示覆盖度较高的代表性 benchmark。越靠近领域中心,表示模型覆盖和来源证据越充分;方向表示所属二级领域。

Catalog 数据目录

用表格浏览全部 benchmark 分组,包括模型覆盖数、厂商数、最佳公开分数和协议标签。

Matrix 矩阵

在每个 benchmark 选定一个有文档记录的协议分组,再展示模型与 benchmark 的紧凑矩阵。空白表示没有兼容报分。

模型筛选

选择一个基础模型后,地图会突出该模型有报分的节点。节点分数采用该模型在所选协议内的最佳公开配置。

地图展示范围

地图只展示一组代表性 landmarks,不等于完整数据目录。地图左上角会显示当前节点数,以及完整 registry 中的 benchmark 总数。

可比排名

BenchAtlas 不会因为 benchmark 名称相同,就把所有分数直接放入同一个排行榜。只有评测协议一致或足够接近的结果,才会进入同一协议分组。

Shared protocol

已有足够的共同配置信息,可以支持直接比较。

Source scoped

记录来自同一报告或表格,但配置尚不足以支持严格的跨报告比较。

Protocol variant

提示用户:benchmark 名称相同并不代表评测条件完全相同。

公开榜单平均百分位

整体排名纳入全部具有公开报分的基础模型,不设置 family、领域、组内模型数或厂商数门槛。可比组贡献归一化排名百分位;单模型组记为中性 50。同一 Benchmark family 的多次出现先取平均,然后直接平均全部已观察到的 family 分数;family 覆盖较少时再向 50 收缩。

置信度

family 数、能力领域覆盖和独立报告数共同决定高、中或暂定置信度。分数更高只表示在当前已观察榜单中的平均位置更高,不代表模型在所有任务上都更强。

不参与模型排名

Agent system、CLI 产品、checkpoint、计算基线和综合指数仍保留在详情与证据中,但不会进入整体排名。

运行配置说明

在详情面板切换 Reported source,可以查看与该条分数对应的评测配置。Method notes 按六类证据组织。

Evaluation setup

Harness、任务环境、超时、计算资源和实现细节。

Reasoning configuration

推理模式、上下文窗口、采样参数和 token 限制。

Agent / tool scaffold

Agent 框架、工具、浏览器、终端、仓库访问方式和限制。

Dataset variant

公开集或内部集、修正任务、子集、语言范围和 benchmark 版本。

Runs and aggregation

运行次数、平均方式、pass@k、投票、Elo 或 judge 聚合方法。

Source caveat

缺失配置、暂未公开分数、内部适配或其他可比性限制。

证据与来源

每条结果都会保留来源报告、URL、证据位置,以及在可用情况下的简短原文。不同报告可能对同一模型和 benchmark 给出不同分数;BenchAtlas 会保留这些记录,而不是静默覆盖。

Reported source

切换不同报告记录,可以查看分数差异及各自对应的运行配置。

可分享页面状态

URL hash 会记录当前 benchmark、协议、模型筛选和视图。点击 Share 可生成当前状态的链接。

关键术语

基础模型 Base model用于模型数量、筛选、覆盖率和整体排名的规范模型身份。
配置 Configuration附属于基础模型的公开推理或推理设置,不作为独立模型。
参考实体 Reference entity为理解结果而保留的 agent system、checkpoint 或 baseline,但不参与模型排名。
Benchmark family跨命名别名、metric 和有意义 variant 的规范 Benchmark 身份。
Benchmark 结果分组由规范 Benchmark、metric 和有意义的 variant 组成的一张结果页。
可比设置组共享足够一致的评测设置、可以直接放在一起排名的记录。
公开报分一条与模型实体、来源证据和运行配置相连的分数记录。