找到 benchmark
搜索 benchmark 或模型名称,按七个一级领域浏览,或者直接点击地图节点。
BenchAtlas 将模型卡和技术报告中的 benchmark、模型分数与运行配置整理成可探索的地图。你可以用它查找公开报分、判断哪些结果可以比较,并查看每个数字背后的评测设置。
一次可靠的比较通常分为四步:先找到 benchmark,再限定可比范围,最后检查配置和原始证据。
搜索 benchmark 或模型名称,按七个一级领域浏览,或者直接点击地图节点。
在右侧详情面板中选择 Evaluation protocol group。只有共享同一评测设置的记录才会一起排名。
查看推理模式、上下文长度、工具、harness、judge、运行次数、聚合方式和数据集变体。
当某个分数将用于决策、文章或研究时,应继续打开原始报告并核对具体页码或表格位置。
四个公开层级分别回答不同问题。能否进入地图只是展示规则,不构成新的数据实体。
合并命名别名、metric 和有意义 variant 后的规范 Benchmark 身份。
由规范 Benchmark、metric 和有意义的 variant 构成;每个分组对应一张结果页。
评测设置足够一致、可以直接放在一起排名的报分记录集合。
一个模型或配置在特定设置下的分数,并保留来源、证据位置和运行配置。
展示覆盖度较高的代表性 benchmark。越靠近领域中心,表示模型覆盖和来源证据越充分;方向表示所属二级领域。
用表格浏览全部 benchmark 分组,包括模型覆盖数、厂商数、最佳公开分数和协议标签。
在每个 benchmark 选定一个有文档记录的协议分组,再展示模型与 benchmark 的紧凑矩阵。空白表示没有兼容报分。
选择一个基础模型后,地图会突出该模型有报分的节点。节点分数采用该模型在所选协议内的最佳公开配置。
地图只展示一组代表性 landmarks,不等于完整数据目录。地图左上角会显示当前节点数,以及完整 registry 中的 benchmark 总数。
BenchAtlas 不会因为 benchmark 名称相同,就把所有分数直接放入同一个排行榜。只有评测协议一致或足够接近的结果,才会进入同一协议分组。
已有足够的共同配置信息,可以支持直接比较。
记录来自同一报告或表格,但配置尚不足以支持严格的跨报告比较。
提示用户:benchmark 名称相同并不代表评测条件完全相同。
整体排名纳入全部具有公开报分的基础模型,不设置 family、领域、组内模型数或厂商数门槛。可比组贡献归一化排名百分位;单模型组记为中性 50。同一 Benchmark family 的多次出现先取平均,然后直接平均全部已观察到的 family 分数;family 覆盖较少时再向 50 收缩。
family 数、能力领域覆盖和独立报告数共同决定高、中或暂定置信度。分数更高只表示在当前已观察榜单中的平均位置更高,不代表模型在所有任务上都更强。
Agent system、CLI 产品、checkpoint、计算基线和综合指数仍保留在详情与证据中,但不会进入整体排名。
在详情面板切换 Reported source,可以查看与该条分数对应的评测配置。Method notes 按六类证据组织。
Harness、任务环境、超时、计算资源和实现细节。
推理模式、上下文窗口、采样参数和 token 限制。
Agent 框架、工具、浏览器、终端、仓库访问方式和限制。
公开集或内部集、修正任务、子集、语言范围和 benchmark 版本。
运行次数、平均方式、pass@k、投票、Elo 或 judge 聚合方法。
缺失配置、暂未公开分数、内部适配或其他可比性限制。
每条结果都会保留来源报告、URL、证据位置,以及在可用情况下的简短原文。不同报告可能对同一模型和 benchmark 给出不同分数;BenchAtlas 会保留这些记录,而不是静默覆盖。
切换不同报告记录,可以查看分数差异及各自对应的运行配置。
URL hash 会记录当前 benchmark、协议、模型筛选和视图。点击 Share 可生成当前状态的链接。