评测科普 · 持续更新

看懂模型分数,
别被排行榜带走。

从 Kimi K3 到 GPT、GLM、DeepSeek,把每个 Benchmark 拆成三件事:测什么、怎么计分、能说明什么。

SCORE ≠ MODEL系统结果
某项得分67.3%
模型版本MODEL
×
推理预算EFFORT
×
执行外壳HARNESS
×
评分方式JUDGE

同一个模型,只要换了提示词、工具权限、重试次数或 Agent 框架,分数就可能不是同一件事。

一个总分不是一种智能先看测试对象,再看名次分数必须绑定评测设置厂商结果不是独立验证场景匹配比榜单第一更重要
01 / 读分方法

任何一张模型评测表,先问四个问题。

评测的本质不是给模型贴一个“聪明”标签,而是用受控任务观察一类行为。 只有测试对象、评分规则和执行条件都清楚,数字才有解释力。

01

测的到底是什么?

先把“智能”拆成知识、推理、编码、Agent、视觉、长上下文等可观察能力。

02

分数怎么来的?

看清 Accuracy、Pass@1、Judge Score 或 Arena Score,不把不同单位硬凑成总分。

03

测试条件一样吗?

核对模型版本、推理档位、工具、Agent harness、采样次数、时间和成本预算。

04

它不能证明什么?

每个基准都只有有限外推范围;高分不是“全能”,更不是你的场景必然更好用。

CASE STUDY

Kimi K3:同一张官方表里,也可能有多套考试条件

官方技术博客 ↗
推理档位MAX

官方说明 K3 结果使用最高 reasoning effort。

执行外壳3 类

KimiCode、Claude Code、Codex 按不同项目混用。

重复运行1–5×

多模态等项目会取多次运行平均,ZeroBench 运行五次。

模型评分器JUDGE

MCP Atlas 使用 Gemini 3.1 Pro 判断任务结果。

正确结论

这些结果能说明 Kimi K3 在指定系统配置下的表现,但如果两行使用不同外壳、预算或评分器,就不能把分差全部归因于底层模型。

02 / 能力地图

“模型能力”不是一根尺,
而是十个不同方向。

每个维度回答一个不同的问题。点击下方基准词典,继续查看它们如何被测量。

01

知识与专业推理

模型知道多少,而且能不能把知识用于陌生问题?

跨学科知识、研究生级科学推理、事实准确性与置信度校准。

MMLU-Pro · GPQA Diamond · HLE
注意会答难题不等于会做开放式研究,也可能受训练数据污染影响。
02

数学与抽象推理

没有现成模板时,模型能否发现规律并完成多步推导?

竞赛数学、符号运算、组合推理、全新视觉规律归纳。

AIME · FrontierMath · ARC-AGI-2
注意分数高度依赖推理预算、采样次数和是否允许工具。
03

编程与软件工程

模型只是会写函数,还是能在真实代码库里修好问题?

算法实现、仓库理解、跨文件修改、测试通过、终端操作。

LiveCodeBench · SWE-bench · Terminal-Bench
注意模型、Agent 外壳、工具权限和计算预算共同决定结果。
04

Agent 与工具使用

模型能否规划、调用工具、处理失败并把任务真正做完?

多步规划、API 调用、状态跟踪、业务规则遵守与交付质量。

GAIA · τ-bench · MCP Atlas
注意同一模型换一套 harness,得分可能显著变化;不能只写模型名。
05

搜索与深度研究

面对散落在网页里的线索,模型能否找到并验证正确答案?

查询改写、多跳搜索、来源判断、持续探索和证据拼接。

BrowseComp · SimpleQA · Search Arena
注意擅长找一个短答案,不代表能写出完整、平衡、可审计的研究报告。
06

视觉与多模态

模型是真的看懂图像、表格和文档,还是只靠文字猜?

图表、示意图、照片、扫描件、页面布局与跨模态推理。

MMMU-Pro · MathVista · DocVQA
注意OCR、视觉定位和知识推理常被混在一个总分里,必须拆开看。
07

长上下文与记忆

上下文窗口很长,模型是否真的能理解和利用其中的信息?

跨文档问答、长对话、代码仓库、结构化数据和关键信息检索。

LongBench v2 · MRCR · NIAH
注意“能塞进 1M tokens”只是容量;不等于每个位置都能稳定召回与推理。
08

指令遵循与可靠性

要求很多、彼此嵌套时,模型能否一条不漏地执行?

格式约束、关键词、长度、优先级、多轮一致性和拒答边界。

IFEval · IFBench · FollowBench
注意可自动验证的格式约束,覆盖不了语气、洞察力和复杂隐含意图。
09

人类偏好与产品体验

真实用户在盲测中,更愿意选择哪个回答或作品?

综合可用性、表达、风格、帮助程度,以及前端与设计成品偏好。

Arena · Arena-Hard · Frontend Arena
注意偏好分是相对排名,会受用户结构、文风、长度和对手池变化影响。
10

安全、事实性与稳健性

模型在高风险、诱导和信息不足时,能否保持有用而不过界?

幻觉、越狱、过度拒答、偏见、健康建议与双重用途风险。

SimpleQA · HealthBench · 系统卡评测
注意安全不是单一分数;更低拒答率有时也可能意味着更高风险。
03 / 计分语言

同样写着“80”,可能完全不是同一种分数。

Accuracy 是答对比例,Pass@k 是给多次机会后的成功率,Arena Score 则是相对偏好。先认单位,才有资格比较。

ACC

Accuracy

答对多少题

正确题数 ÷ 总题数

题目难度、随机猜中率和题集版本不同,百分比不能跨基准直接比。

EM

Exact Match

答案是否完全匹配

完全匹配记 1,否则记 0

严格但可能错杀语义等价答案;必须说明是否做格式归一化。

P@1

Pass@1

第一次生成就成功

首个样本通过全部检查的任务比例

温度、提示词和是否允许重试都会影响结果。

P@K

Pass@k

给 k 次机会能否至少成功一次

k 个样本中至少一个通过

k 越大分越高,同时成本也更高,不能与 Pass@1 混读。

RES

Resolved Rate

真实任务是否修好

通过目标与回归测试的任务比例

测试本身可能有缺陷;结果属于整个 Agent 系统。

JDG

Judge Score

由人或另一个模型按规则打分

rubric 分项判定后聚合

必须公开评分器版本、rubric、顺序偏差和人工复核方式。

ARE

Arena Score

盲测里相对更受偏好

成对胜负拟合相对强度

不是百分制;对手池和投票分布变化,分数也会漂移。

04 / 基准词典

搜索一个 Benchmark,拆开看它的证据边界。

首版收录最常出现在前沿模型发布材料里的代表性评测。 每张卡都回答:测什么、怎么计分、为什么有效、不能说明什么。

19个基准
知识与专业推理进阶

MMLU-Pro

覆盖多学科的 10 选 1 难题,比原版 MMLU 更强调推理、降低猜中概率。

Accuracy展开解码 +

Massive Multitask Language Understanding Pro

怎么计分
Accuracy:答对题数 ÷ 总题数。
为什么有效
题目有明确答案、学科覆盖广,适合观察知识面与推理结合后的稳定性。
高分能说明
较强的闭卷知识调用和多选推理能力。
不能说明
开放写作、工具使用、真实工作流;公开题也存在污染风险。
查看原始来源:MMLU-Pro 论文
知识与专业推理前沿

GPQA Diamond

由生物、物理、化学专家编写的研究生级多选题,Diamond 是最难且验证更严格的子集。

Pass@1 / Accuracy展开解码 +

Graduate-Level Google-Proof Q&A — Diamond

怎么计分
Pass@1 / Accuracy:第一次作答正确的比例。
为什么有效
非本领域专家即使搜索也很难答对,能拉开高阶科学推理差距。
高分能说明
在特定 STEM 难题上的知识深度与多步推理。
不能说明
题量较小,置信区间不可忽略;不代表科研执行能力。
查看原始来源:GPQA 论文
知识与专业推理前沿

Humanity’s Last Exam

跨上百个学科的专家级短答与选择题,包含多模态题目。

Accuracy,并常配合 calibration error 观察模型是否知道自己可能错。展开解码 +

Humanity’s Last Exam (HLE)

怎么计分
Accuracy,并常配合 calibration error 观察模型是否知道自己可能错。
为什么有效
题目难、覆盖宽、答案可验证,可避免老基准接近满分后的失真。
高分能说明
封闭式专家知识题的前沿水平与置信度校准。
不能说明
高分不等于 AGI、自治研究或长期项目交付;题目质量仍需持续审计。
查看原始来源:HLE 论文
数学与抽象推理进阶

AIME

答案为 000–999 整数的竞赛数学题,覆盖代数、几何、数论与组合。

Accuracy / Pass@1;也有人报告多次采样后的 pass@k。展开解码 +

American Invitational Mathematics Examination

怎么计分
Accuracy / Pass@1;也有人报告多次采样后的 pass@k。
为什么有效
答案短且可自动核验,题目通常要求连续推导而不是复述知识。
高分能说明
竞赛型数学推理、计算与自检能力。
不能说明
年份、提示词、工具、采样次数不同就不能直接横比。
查看原始来源:MAA AIME
数学与抽象推理前沿

ARC-AGI-2

观察少量彩色网格示例,归纳此前未见的变换规则并生成正确输出。

完全匹配的任务比例;输出网格必须逐格正确。展开解码 +

Abstraction and Reasoning Corpus 2

怎么计分
完全匹配的任务比例;输出网格必须逐格正确。
为什么有效
每题规则不同,主要考察从少量例子抽象出新规律,而不是知识背诵。
高分能说明
受控环境里的新颖抽象、组合与泛化能力。
不能说明
任务形式高度人工化;与语言、知识工作和真实 Agent 能力相关但不等价。
查看原始来源:ARC Prize 官方说明
数学与抽象推理前沿

FrontierMath

由数学家创作、部分达到研究前沿难度的原创题,题目尽量保持私有。

正确率;不同 tier 应分开报告。展开解码 +

FrontierMath

怎么计分
正确率;不同 tier 应分开报告。
为什么有效
原创、私有和高难度设计降低背题与饱和问题。
高分能说明
高阶数学创造性推理与精确计算。
不能说明
对评测实现、专家答案与工具权限敏感;样本少时波动较大。
查看原始来源:Epoch AI 官方说明
编程与软件工程进阶

LiveCodeBench

按时间持续收集新发布的竞赛编程题,用隐藏测试验证生成代码。

Pass@1展开解码 +

LiveCodeBench

怎么计分
Pass@1:第一次生成就通过全部测试的题目比例。
为什么有效
时间切分有助于降低训练数据污染,隐藏测试比文字相似度更可靠。
高分能说明
从题意到可运行算法的实现能力。
不能说明
不测试大型仓库理解、需求澄清、维护性和协作开发。
查看原始来源:LiveCodeBench
编程与软件工程前沿

SWE-bench

给模型真实 GitHub issue 和代码库,让 Agent 修改代码并通过回归测试。

Resolved rate展开解码 +

Software Engineering Benchmark

怎么计分
Resolved rate:成功解决且通过指定测试的 issue 比例。
为什么有效
把读仓库、定位问题、编辑多文件和运行测试放进同一真实工程任务。
高分能说明
在特定仓库与 Agent 配置下解决真实软件问题的能力。
不能说明
公开仓库会污染;测试可能漏判正确修复。Verified 已出现饱和和题目缺陷争议。
查看原始来源:SWE-bench 官方站
编程与软件工程前沿

Terminal-Bench

在隔离终端中完成编译、调试、数据处理、系统配置等复杂任务。

Task success rate;由任务专用测试验证最终环境状态。展开解码 +

Terminal-Bench

怎么计分
Task success rate;由任务专用测试验证最终环境状态。
为什么有效
不仅看文本答案,而是检查 Agent 是否真的把计算机状态改对。
高分能说明
命令行规划、迭代、工具协调和错误恢复。
不能说明
成绩属于“模型 + Agent + 工具 + 预算”系统,不是裸模型智力。
查看原始来源:Terminal-Bench
Agent 与工具使用进阶

GAIA

需要搜索、代码、文件理解和多步推理才能回答的真实助理任务,分三个难度等级。

最终答案 Exact Match / 准确率,并按 Level 分层。展开解码 +

General AI Assistants

怎么计分
最终答案 Exact Match / 准确率,并按 Level 分层。
为什么有效
单靠语言模型记忆通常不够,必须组合多种工具与推理。
高分能说明
通用助理在异构信息和多工具任务中的完成能力。
不能说明
短答案评分难以覆盖过程质量、引用质量和用户满意度。
查看原始来源:GAIA 论文
Agent 与工具使用前沿

τ-bench

在航空、零售等模拟业务里,多轮对话并调用 API,同时遵守业务规则。

Pass^k / 任务成功率展开解码 +

Tool-Agent-User Interaction Benchmark

怎么计分
Pass^k / 任务成功率:既完成用户目标,也满足数据库状态与规则检查。
为什么有效
把沟通、规则理解、工具调用和状态更新放在同一个可验证环境。
高分能说明
面向业务流程的工具 Agent 可靠性。
不能说明
模拟环境比真实企业系统干净;覆盖行业有限。
查看原始来源:τ-bench 论文
搜索与深度研究前沿

BrowseComp

在公开网页中寻找难以检索、需要多跳拼接的单一短答案。

Accuracy展开解码 +

Browsing Competition

怎么计分
Accuracy:最终短答案是否与标准答案一致。
为什么有效
答案难找但容易核验,能测试搜索策略、坚持度和证据拼接。
高分能说明
定位稀有事实、改写查询和跨来源推理。
不能说明
不代表能写好开放式研究报告;网页变化也会改变任务难度。
查看原始来源:OpenAI BrowseComp
视觉与多模态前沿

MMMU-Pro

用图表、示意图、地图、乐谱、化学结构等完成大学级跨学科问题。

Accuracy;常需注明标准输入或 vision-only 等设置。展开解码 +

Massive Multi-discipline Multimodal Understanding Pro

怎么计分
Accuracy;常需注明标准输入或 vision-only 等设置。
为什么有效
过滤部分纯文本可答题,并加入更强视觉依赖,减少模型只靠文字猜答案。
高分能说明
视觉感知、专业知识与推理的联合能力。
不能说明
不能单独定位失败来自 OCR、看图、知识还是推理。
查看原始来源:MMMU-Pro 论文
长上下文与记忆前沿

LongBench v2

在 8K 到 2M 词的文档、对话、代码库和结构化数据中理解并推理。

多选 Accuracy,并可按上下文长度和任务类型切片。展开解码 +

LongBench v2

怎么计分
多选 Accuracy,并可按上下文长度和任务类型切片。
为什么有效
问题不仅要找到片段,还要求跨段、跨文档整合和深层推理。
高分能说明
真实长材料中的检索、理解和推理能力。
不能说明
不等于长期记忆;模型上下文上限与有效利用率是两件事。
查看原始来源:LongBench v2
长上下文与记忆基础

NIAH

把一条关键信息埋进不同长度、不同位置的长文本,再要求模型找回。

召回正确率,通常画成“长度 × 位置”的热力图。展开解码 +

Needle In A Haystack

怎么计分
召回正确率,通常画成“长度 × 位置”的热力图。
为什么有效
简单、便宜,能快速发现模型在某些位置或长度上的明显失忆。
高分能说明
长文本中的基础检索与位置鲁棒性。
不能说明
不测试跨段综合、复杂推理和真实噪声;很容易被专门优化。
查看原始来源:NIAH 实现
指令遵循与可靠性基础

IFEval

要求输出满足可自动检查的约束,如字数、关键词、格式或特定结构。

Prompt-level / Instruction-level strict accuracy。展开解码 +

Instruction-Following Evaluation

怎么计分
Prompt-level / Instruction-level strict accuracy。
为什么有效
规则明确且可程序化验证,减少主观评分器带来的漂移。
高分能说明
遵守显式、可验证指令的稳定性。
不能说明
不覆盖隐含意图、内容质量、审美与多轮目标管理。
查看原始来源:IFEval 论文
人类偏好与产品体验进阶

Arena

同一真实用户问题由两个匿名模型回答,用户盲选更好的一个或判平。

基于成对胜负的 Bradley–Terry / Arena Score,并报告置信区间。展开解码 +

Chatbot Arena / Arena

怎么计分
基于成对胜负的 Bradley–Terry / Arena Score,并报告置信区间。
为什么有效
直接收集真实用户偏好,覆盖静态题库很难穷举的开放式体验。
高分能说明
在该用户与题目分布下,相对于对手池的综合偏好。
不能说明
不是绝对能力分;文风、长度、用户结构和榜单时间都会影响结果。
查看原始来源:Arena 方法说明
安全、事实性与稳健性基础

SimpleQA

用答案明确、时间稳定的短事实题检查正确回答、错误回答与拒答。

Correct / Incorrect / Not attempted,并可观察校准与幻觉倾向。展开解码 +

SimpleQA

怎么计分
Correct / Incorrect / Not attempted,并可观察校准与幻觉倾向。
为什么有效
把“答错”和“知道自己不知道”分开,比只看命中率更能反映事实可靠性。
高分能说明
短事实问答的正确性和保守程度。
不能说明
不代表长答案的引用质量,也不覆盖开放世界事实的时效变化。
查看原始来源:OpenAI SimpleQA
安全、事实性与稳健性前沿

HealthBench

由医生编写真实医疗对话场景与细粒度 rubric,评估有用性、准确性与安全性。

按医生制定的 rubric 逐项判分,再聚合为总体及切片结果。展开解码 +

HealthBench

怎么计分
按医生制定的 rubric 逐项判分,再聚合为总体及切片结果。
为什么有效
医疗回答很少只有一个标准句,需要按风险、完整性和沟通质量拆分评分。
高分能说明
特定医疗对话分布上的回答质量和安全边界。
不能说明
不能替代临床验证、监管审批或医生诊断。
查看原始来源:OpenAI HealthBench
05 / 模型档案

跟踪模型系列,但不追着传言填分。

每次新模型发布,先登记官方型号、日期和评测配置,再把分数映射到能力维度。 GPT-6 这类尚无正式来源的名字,只保留观察位。

Moonshot AI

Kimi K3

已发布

编码 Agent · 生产力 · 多模态 · 长上下文

官方表格混用 KimiCode、Claude Code、Codex 等 harness。官方说明 K3 结果使用 max reasoning;跨模型比较时必须逐行核对执行环境。

查看官方来源 ↗
06 / 截图排雷

一张榜单出现这些信号,
先别急着转发。

单个问题不一定推翻结果,但红旗越多,结论的可信度越低。

高:官方方法 + 可复核 中:设置明确,待独立复测 低:截图或二手转述
01

只给总分,不给分项

无法判断优势来自知识、工具还是某一类题。

02

只写模型名,不写版本

同系列不同日期、推理档位和产品路由可能不是同一个系统。

03

混用 Pass@1 与 Pass@k

多次尝试的最好结果,不能冒充第一次成功率。

04

忽略 Agent harness

KimiCode、Claude Code、Codex 或自研 Agent 会改变工具、提示和恢复策略。

05

没有置信区间或样本量

小题集的几分差距,可能只是抽样和随机性。

06

厂商分数当独立结论

官方结果可以作为一手材料,但仍需看设置、复测与失败样本。

07

只看能力,不看成本

更高推理预算、多 Agent 和更多采样,可能用数倍成本换来几分。

08

公开旧题仍当新鲜证据

训练污染和 benchmark saturation 会让分数失去区分度。

最终判断

最好的模型,不是榜单第一;是与你的任务最匹配。

你的真实任务对应能力维度可信基准组合小规模实测

用公开基准筛掉明显不合适的模型,再用自己的 20–100 个真实任务做最终选择。公开分数是地图,不是目的地。