评测科普 · 持续更新

看懂模型分数,
别被排行榜带走。

以 MiMo V2.6 Pro / Flash 为最新案例,把每个 Benchmark 拆成三件事:测什么、怎么计分、能说明什么。

SCORE ≠ MODEL系统结果
某项得分67.3%
模型版本MODEL
×
推理预算EFFORT
×
执行外壳HARNESS
×
评分方式JUDGE

同一个模型,只要换了提示词、工具权限、重试次数或 Agent 框架,分数就可能不是同一件事。

一个总分不是一种智能✦先看测试对象,再看名次✦分数必须绑定评测设置✦厂商结果不是独立验证✦场景匹配比榜单第一更重要
01 / 读分方法

任何一张模型评测表,先问四个问题。

评测的本质不是给模型贴一个“聪明”标签,而是用受控任务观察一类行为。 只有测试对象、评分规则和执行条件都清楚,数字才有解释力。

01

测的到底是什么?

先把“智能”拆成知识、推理、编码、Agent、视觉、长上下文等可观察能力。

02

分数怎么来的?

看清 Accuracy、Pass@1、Judge Score 或 Arena Score,不把不同单位硬凑成总分。

03

测试条件一样吗?

核对模型版本、推理档位、工具、Agent harness、采样次数、时间和成本预算。

04

它不能证明什么?

每个基准都只有有限外推范围;高分不是“全能”,更不是你的场景必然更好用。

LATEST CASE · MiMo V2.6

MiMo V2.6:从写代码,到完成一项复杂任务。

查看官方发布页 ↗
仓库修复 · Pro / Flash71.9 / 67.9

DeepSWE v1.1,官方模型卡结果;观察修改能否通过任务验证。

终端任务 · Pro / Flash89.9 / 87.6

Terminal-Bench 2.1;不能与 4.0 版直接比较。

电脑操作 · Pro / Flash82.0 / 80.8

OSWorld-Verified;衡量测试环境中的 GUI 任务完成情况。

长程难题 · Pro / Flash31.6 / 27.6

Agents’ Last Exam;高难任务仍有明显改进空间。

能力结论

MiMo 系列值得进入工程与电脑操作任务的候选集。Pro 并非每项都领先 Flash;分数属于模型与工具共同完成的系统表现。这里展示厂商报告,未进行本站独立复测,也不生成综合排名。

02 / 能力地图

“模型能力”不是一根尺,
而是十个不同方向。

每个维度回答一个不同的问题。点击下方基准词典,继续查看它们如何被测量。

01

知识与专业推理

模型知道多少,而且能不能把知识用于陌生问题?

跨学科知识、研究生级科学推理、事实准确性与置信度校准。

MMLU-Pro · GPQA Diamond · HLE
注意会答难题不等于会做开放式研究,也可能受训练数据污染影响。
02

数学与抽象推理

没有现成模板时,模型能否发现规律并完成多步推导?

竞赛数学、符号运算、组合推理、全新视觉规律归纳。

AIME · FrontierMath · ARC-AGI-2
注意分数高度依赖推理预算、采样次数和是否允许工具。
03

编程与软件工程

模型只是会写函数,还是能在真实代码库里修好问题?

算法实现、仓库理解、跨文件修改、测试通过、终端操作。

LiveCodeBench · SWE-bench · Terminal-Bench
注意模型、Agent 外壳、工具权限和计算预算共同决定结果。
04

Agent 与工具使用

模型能否规划、调用工具、处理失败并把任务真正做完?

多步规划、API 调用、状态跟踪、业务规则遵守与交付质量。

GAIA · τ-bench · MCP Atlas
注意同一模型换一套 harness,得分可能显著变化;不能只写模型名。
05

搜索与深度研究

面对散落在网页里的线索,模型能否找到并验证正确答案?

查询改写、多跳搜索、来源判断、持续探索和证据拼接。

BrowseComp · SimpleQA · Search Arena
注意擅长找一个短答案,不代表能写出完整、平衡、可审计的研究报告。
06

视觉与多模态

模型是真的看懂图像、表格和文档,还是只靠文字猜?

图表、示意图、照片、扫描件、页面布局与跨模态推理。

MMMU-Pro · MathVista · DocVQA
注意OCR、视觉定位和知识推理常被混在一个总分里,必须拆开看。
07

长上下文与记忆

上下文窗口很长,模型是否真的能理解和利用其中的信息?

跨文档问答、长对话、代码仓库、结构化数据和关键信息检索。

LongBench v2 · MRCR · NIAH
注意“能塞进 1M tokens”只是容量;不等于每个位置都能稳定召回与推理。
08

指令遵循与可靠性

要求很多、彼此嵌套时,模型能否一条不漏地执行?

格式约束、关键词、长度、优先级、多轮一致性和拒答边界。

IFEval · IFBench · FollowBench
注意可自动验证的格式约束,覆盖不了语气、洞察力和复杂隐含意图。
09

人类偏好与产品体验

真实用户在盲测中,更愿意选择哪个回答或作品?

综合可用性、表达、风格、帮助程度,以及前端与设计成品偏好。

Arena · Arena-Hard · Frontend Arena
注意偏好分是相对排名,会受用户结构、文风、长度和对手池变化影响。
10

安全、事实性与稳健性

模型在高风险、诱导和信息不足时,能否保持有用而不过界?

幻觉、越狱、过度拒答、偏见、健康建议与双重用途风险。

SimpleQA · HealthBench · 系统卡评测
注意安全不是单一分数;更低拒答率有时也可能意味着更高风险。
03 / 计分语言

同样写着“80”,可能完全不是同一种分数。

Accuracy 是答对比例,Pass@k 是给多次机会后的成功率,Arena Score 则是相对偏好。先认单位,才有资格比较。

ACC

Accuracy

答对多少题

正确题数 ÷ 总题数

就像上学时的卷面分:100 道题答对 87 道,就是 87 分。

题目难度、随机猜中率和题集版本不同,百分比不能跨基准直接比。

EM

Exact Match

答案是否完全匹配

完全匹配记 1,否则记 0

答案必须一字不差才算对;意思对了但写法不同,也记零分。

严格但可能错杀语义等价答案;必须说明是否做格式归一化。

P@1

Pass@1

第一次生成就成功

首个样本通过全部检查的任务比例

只承认第一次交的答卷,相当于不许涂改、不许重考。

温度、提示词和是否允许重试都会影响结果。

P@K

Pass@k

给 k 次机会能否至少成功一次

k 个样本中至少一个通过

给好几次机会,只要中一次就算过;机会越多分越高,也越费钱。

k 越大分越高,同时成本也更高,不能与 Pass@1 混读。

RES

Resolved Rate

真实任务是否修好

通过目标与回归测试的任务比例

不是答对题,而是把真实软件的毛病真的修好,并且回归测试全通过。

测试本身可能有缺陷;结果属于整个 Agent 系统。

JDG

Judge Score

由人或另一个模型按规则打分

rubric 分项判定后聚合

换一位阅卷老师按评分细则打分;老师不同,分数也可能不同。

必须公开评分器版本、rubric、顺序偏差和人工复核方式。

ARE

Arena Score

盲测里相对更受偏好

成对胜负拟合相对强度

像匿名盲测打分:两个作品摆一起让用户挑,赢得多声誉就高;对手换了分也会变。

不是百分制;对手池和投票分布变化,分数也会漂移。

04 / 基准词典

搜索一个 Benchmark,拆开看它的证据边界。

首版收录最常出现在前沿模型发布材料里的代表性评测。 每张卡都回答:测什么、怎么计分、为什么有效、不能说明什么。

19个基准
知识与专业推理进阶

MMLU-Pro

覆盖多学科的 10 选 1 难题,比原版 MMLU 更强调推理、降低猜中概率。

Accuracy展开解码 +

Massive Multitask Language Understanding Pro

人话给模型出一份几十个学科混在一起的加难高考卷,看它知识面广不广、稳不稳。

怎么计分
Accuracy:答对题数 ÷ 总题数。
为什么有效
题目有明确答案、学科覆盖广,适合观察知识面与推理结合后的稳定性。
高分能说明
较强的闭卷知识调用和多选推理能力。
不能说明
开放写作、工具使用、真实工作流;公开题也存在污染风险。
查看原始来源:MMLU-Pro 论文 ↗
知识与专业推理前沿

GPQA Diamond

由生物、物理、化学专家编写的研究生级多选题,Diamond 是最难且验证更严格的子集。

Pass@1 / Accuracy展开解码 +

Graduate-Level Google-Proof Q&A — Diamond

人话让模型做连研究生都会卡壳的理化生难题,看它是真懂还是背答案。

怎么计分
Pass@1 / Accuracy:第一次作答正确的比例。
为什么有效
非本领域专家即使搜索也很难答对,能拉开高阶科学推理差距。
高分能说明
在特定 STEM 难题上的知识深度与多步推理。
不能说明
题量较小,置信区间不可忽略;不代表科研执行能力。
查看原始来源:GPQA 论文 ↗
知识与专业推理前沿

Humanity’s Last Exam

跨上百个学科的专家级短答与选择题,包含多模态题目。

Accuracy,并常配合 calibration error 观察模型是否知道自己可能错。展开解码 +

Humanity’s Last Exam (HLE)

人话一份号称史上最难的百科大考,专门防止模型把老题库背熟后冒充满分。

怎么计分
Accuracy,并常配合 calibration error 观察模型是否知道自己可能错。
为什么有效
题目难、覆盖宽、答案可验证,可避免老基准接近满分后的失真。
高分能说明
封闭式专家知识题的前沿水平与置信度校准。
不能说明
高分不等于 AGI、自治研究或长期项目交付;题目质量仍需持续审计。
查看原始来源:HLE 论文 ↗
数学与抽象推理进阶

AIME

答案为 000–999 整数的竞赛数学题,覆盖代数、几何、数论与组合。

Accuracy / Pass@1;也有人报告多次采样后的 pass@k。展开解码 +

American Invitational Mathematics Examination

人话让模型参加美国数学竞赛,答案是一个整数,没法用废话蒙混,考硬推导。

怎么计分
Accuracy / Pass@1;也有人报告多次采样后的 pass@k。
为什么有效
答案短且可自动核验,题目通常要求连续推导而不是复述知识。
高分能说明
竞赛型数学推理、计算与自检能力。
不能说明
年份、提示词、工具、采样次数不同就不能直接横比。
查看原始来源:MAA AIME ↗
数学与抽象推理前沿

ARC-AGI-2

观察少量彩色网格示例,归纳此前未见的变换规则并生成正确输出。

完全匹配的任务比例;输出网格必须逐格正确。展开解码 +

Abstraction and Reasoning Corpus 2

人话给模型看几组找规律图形,让它自己总结规律再画出下一张,专考举一反三。

怎么计分
完全匹配的任务比例;输出网格必须逐格正确。
为什么有效
每题规则不同,主要考察从少量例子抽象出新规律,而不是知识背诵。
高分能说明
受控环境里的新颖抽象、组合与泛化能力。
不能说明
任务形式高度人工化;与语言、知识工作和真实 Agent 能力相关但不等价。
查看原始来源:ARC Prize 官方说明 ↗
数学与抽象推理前沿

FrontierMath

由数学家创作、部分达到研究前沿难度的原创题,题目尽量保持私有。

正确率;不同 tier 应分开报告。展开解码 +

FrontierMath

人话数学家出的私房难题,网上搜不到,考的是研究级的数学创造力和精确度。

怎么计分
正确率;不同 tier 应分开报告。
为什么有效
原创、私有和高难度设计降低背题与饱和问题。
高分能说明
高阶数学创造性推理与精确计算。
不能说明
对评测实现、专家答案与工具权限敏感;样本少时波动较大。
查看原始来源:Epoch AI 官方说明 ↗
编程与软件工程进阶

LiveCodeBench

按时间持续收集新发布的竞赛编程题,用隐藏测试验证生成代码。

Pass@1展开解码 +

LiveCodeBench

人话让模型现场做编程题,写完直接跑测试,跑不过就是零分,考真功夫。

怎么计分
Pass@1:第一次生成就通过全部测试的题目比例。
为什么有效
时间切分有助于降低训练数据污染,隐藏测试比文字相似度更可靠。
高分能说明
从题意到可运行算法的实现能力。
不能说明
不测试大型仓库理解、需求澄清、维护性和协作开发。
查看原始来源:LiveCodeBench ↗
编程与软件工程前沿

SWE-bench

给模型真实 GitHub issue 和代码库,让 Agent 修改代码并通过回归测试。

Resolved rate展开解码 +

Software Engineering Benchmark

人话把真实软件项目的报错工单甩给模型,要它钻进整个代码库把毛病修好。

怎么计分
Resolved rate:成功解决且通过指定测试的 issue 比例。
为什么有效
把读仓库、定位问题、编辑多文件和运行测试放进同一真实工程任务。
高分能说明
在特定仓库与 Agent 配置下解决真实软件问题的能力。
不能说明
公开仓库会污染;测试可能漏判正确修复。Verified 已出现饱和和题目缺陷争议。
查看原始来源:SWE-bench 官方站 ↗
编程与软件工程前沿

Terminal-Bench

在隔离终端中完成编译、调试、数据处理、系统配置等复杂任务。

Task success rate;由任务专用测试验证最终环境状态。展开解码 +

Terminal-Bench

人话把模型丢进一台电脑里干活,装环境、跑命令、修错误,最后检查电脑状态对不对。

怎么计分
Task success rate;由任务专用测试验证最终环境状态。
为什么有效
不仅看文本答案,而是检查 Agent 是否真的把计算机状态改对。
高分能说明
命令行规划、迭代、工具协调和错误恢复。
不能说明
成绩属于“模型 + Agent + 工具 + 预算”系统,不是裸模型智力。
查看原始来源:Terminal-Bench ↗
Agent 与工具使用进阶

GAIA

需要搜索、代码、文件理解和多步推理才能回答的真实助理任务,分三个难度等级。

最终答案 Exact Match / 准确率,并按 Level 分层。展开解码 +

General AI Assistants

人话给模型派真实助理任务,查资料、读文件、算数据,几步全做完才算通过。

怎么计分
最终答案 Exact Match / 准确率,并按 Level 分层。
为什么有效
单靠语言模型记忆通常不够,必须组合多种工具与推理。
高分能说明
通用助理在异构信息和多工具任务中的完成能力。
不能说明
短答案评分难以覆盖过程质量、引用质量和用户满意度。
查看原始来源:GAIA 论文 ↗
Agent 与工具使用前沿

τ-bench

在航空、零售等模拟业务里,多轮对话并调用 API,同时遵守业务规则。

Pass^k / 任务成功率展开解码 +

Tool-Agent-User Interaction Benchmark

人话让模型扮演航空公司或电商客服,一边跟用户聊一边操作系统,还不能坏业务规矩。

怎么计分
Pass^k / 任务成功率:既完成用户目标,也满足数据库状态与规则检查。
为什么有效
把沟通、规则理解、工具调用和状态更新放在同一个可验证环境。
高分能说明
面向业务流程的工具 Agent 可靠性。
不能说明
模拟环境比真实企业系统干净;覆盖行业有限。
查看原始来源:τ-bench 论文 ↗
搜索与深度研究前沿

BrowseComp

在公开网页中寻找难以检索、需要多跳拼接的单一短答案。

Accuracy展开解码 +

Browsing Competition

人话出一个网上很难搜到的冷门问题,看模型能不能翻遍网页把唯一正确答案找出来。

怎么计分
Accuracy:最终短答案是否与标准答案一致。
为什么有效
答案难找但容易核验,能测试搜索策略、坚持度和证据拼接。
高分能说明
定位稀有事实、改写查询和跨来源推理。
不能说明
不代表能写好开放式研究报告;网页变化也会改变任务难度。
查看原始来源:OpenAI BrowseComp ↗
视觉与多模态前沿

MMMU-Pro

用图表、示意图、地图、乐谱、化学结构等完成大学级跨学科问题。

Accuracy;常需注明标准输入或 vision-only 等设置。展开解码 +

Massive Multi-discipline Multimodal Understanding Pro

人话给模型看图表、乐谱、化学结构再提大学问题,考它是真看懂了还是在瞎猜。

怎么计分
Accuracy;常需注明标准输入或 vision-only 等设置。
为什么有效
过滤部分纯文本可答题,并加入更强视觉依赖,减少模型只靠文字猜答案。
高分能说明
视觉感知、专业知识与推理的联合能力。
不能说明
不能单独定位失败来自 OCR、看图、知识还是推理。
查看原始来源:MMMU-Pro 论文 ↗
长上下文与记忆前沿

LongBench v2

在 8K 到 2M 词的文档、对话、代码库和结构化数据中理解并推理。

多选 Accuracy,并可按上下文长度和任务类型切片。展开解码 +

LongBench v2

人话塞给模型一部上百页的材料再提问,看它是不是真读完、还能串起来推理。

怎么计分
多选 Accuracy,并可按上下文长度和任务类型切片。
为什么有效
问题不仅要找到片段,还要求跨段、跨文档整合和深层推理。
高分能说明
真实长材料中的检索、理解和推理能力。
不能说明
不等于长期记忆;模型上下文上限与有效利用率是两件事。
查看原始来源:LongBench v2 ↗
长上下文与记忆基础

NIAH

把一条关键信息埋进不同长度、不同位置的长文本,再要求模型找回。

召回正确率,通常画成“长度 × 位置”的热力图。展开解码 +

Needle In A Haystack

人话在一本厚书里藏一句话,再考模型能不能找回来,测的是长文本的记性。

怎么计分
召回正确率,通常画成“长度 × 位置”的热力图。
为什么有效
简单、便宜,能快速发现模型在某些位置或长度上的明显失忆。
高分能说明
长文本中的基础检索与位置鲁棒性。
不能说明
不测试跨段综合、复杂推理和真实噪声;很容易被专门优化。
查看原始来源:NIAH 实现 ↗
指令遵循与可靠性基础

IFEval

要求输出满足可自动检查的约束,如字数、关键词、格式或特定结构。

Prompt-level / Instruction-level strict accuracy。展开解码 +

Instruction-Following Evaluation

人话给模型下硬要求,比如必须多少字、用什么格式,做不到就扣分,测听不听话。

怎么计分
Prompt-level / Instruction-level strict accuracy。
为什么有效
规则明确且可程序化验证,减少主观评分器带来的漂移。
高分能说明
遵守显式、可验证指令的稳定性。
不能说明
不覆盖隐含意图、内容质量、审美与多轮目标管理。
查看原始来源:IFEval 论文 ↗
人类偏好与产品体验进阶

Arena

同一真实用户问题由两个匿名模型回答,用户盲选更好的一个或判平。

基于成对胜负的 Bradley–Terry / Arena Score,并报告置信区间。展开解码 +

Chatbot Arena / Arena

人话两个模型匿名回答同一个问题,真人盲选哪个好,像打分点评,比的是受欢迎程度。

怎么计分
基于成对胜负的 Bradley–Terry / Arena Score,并报告置信区间。
为什么有效
直接收集真实用户偏好,覆盖静态题库很难穷举的开放式体验。
高分能说明
在该用户与题目分布下,相对于对手池的综合偏好。
不能说明
不是绝对能力分;文风、长度、用户结构和榜单时间都会影响结果。
查看原始来源:Arena 方法说明 ↗
安全、事实性与稳健性基础

SimpleQA

用答案明确、时间稳定的短事实题检查正确回答、错误回答与拒答。

Correct / Incorrect / Not attempted,并可观察校准与幻觉倾向。展开解码 +

SimpleQA

人话问模型一堆有标准答案的小知识题,答错和老实说不知道分开记账,测它老不老实。

怎么计分
Correct / Incorrect / Not attempted,并可观察校准与幻觉倾向。
为什么有效
把“答错”和“知道自己不知道”分开,比只看命中率更能反映事实可靠性。
高分能说明
短事实问答的正确性和保守程度。
不能说明
不代表长答案的引用质量,也不覆盖开放世界事实的时效变化。
查看原始来源:OpenAI SimpleQA ↗
安全、事实性与稳健性前沿

HealthBench

由医生编写真实医疗对话场景与细粒度 rubric,评估有用性、准确性与安全性。

按医生制定的 rubric 逐项判分,再聚合为总体及切片结果。展开解码 +

HealthBench

人话让模型回答真实医疗咨询,由真医生按细则打分,考的是专业又安全的分寸感。

怎么计分
按医生制定的 rubric 逐项判分,再聚合为总体及切片结果。
为什么有效
医疗回答很少只有一个标准句,需要按风险、完整性和沟通质量拆分评分。
高分能说明
特定医疗对话分布上的回答质量和安全边界。
不能说明
不能替代临床验证、监管审批或医生诊断。
查看原始来源:OpenAI HealthBench ↗
05 / 模型分数对比

MiMo、GLM、DeepSeek:能力、速度,分开看。

先看 MiMo V2.6 双模型,再对照 GLM Flash / FlashX 与 DeepSeek V4.1 Flash。各家自报成绩仅作证据对照,不是统一复测排名。

2026.09.22 · MiMo V2.6

先看能完成什么,再看完成一次的代价。

Pro 与 Flash 均支持原生多模态和 1M 上下文。Pro 可进入复杂工程候选;Flash 可进入高频任务候选。最终选择要一起测成功率、等待时间、重试与总费用。

MiMo-V2.6-Pro

官方模型卡:1.02T 总参数、42B 激活参数;DeepSWE v1.1 为 71.9。可列入复杂工程候选,仍需核对工具配置与任务成本。开放检查点名为 MiMo-V2.6-Pro-RL,不将 API 与本地部署表现视为完全一致。

官方模型卡 ↗

MiMo-V2.6-Flash

官方模型卡:309B 总参数、15B 激活参数;DeepSWE v1.1 为 67.9。体量小于 Pro,但不能据此直接推出真实任务更便宜或更快;需要连同重试次数实测。

官方模型卡 ↗
最新案例展示

MiMo 的三个应用方向

以下为小米官方演示摘要,本站未独立复现。

01 / 游戏与 3D

构建可交互世界

官方展示了从需求到场景、交互与视觉检查的协作流程。

怎么看:验收要看能否完整游玩、操作是否正确;画面好看不代表逻辑可靠。

查看原始演示与说明 ↗
02 / 材料与数学

辅助科研探索

官方展示 Pro 辅助材料计算筛选与 Lean 形式化证明。

怎么看:材料候选仍需实验;证明案例包含研究员引导和后续修订。

查看原始演示与说明 ↗
03 / 网页与视频

交付内容作品

官方展示了网页、幻灯片与科普视频等工具协作产物。

怎么看:这些是精选演示,未披露任务总体成功率;不能代表一次生成即可交付。

查看原始演示与说明 ↗
八项证据 · 不合成总分

同名基准,先并列披露。

数值为官方报告值,越高通常越好。跨厂商并非同一次实验,不能将小差距解释为稳定领先。FlashX 未找到单独评测表,留空而不借用 Flash 成绩。

MiMo / GLM / DeepSeek 官方结果 · 核对日期 2026-09-22
基准与口径MiMo V2.6
Pro ↗
MiMo V2.6
Flash ↗
GLM-5.3
Flash ↗
GLM-5.3
FlashX ↗
DeepSeek V4.1
Flash ↗
DeepSWE v1.1Resolved / 官方报告值71.967.963.4未报告74.2
Terminal-Bench 2.1任务通过率 / %89.987.684.3未报告90.6
Terminal-Bench 4.0任务通过率 / %34.928.8未报告未报告31.2
ProgramBench官方报告值;DeepSeek 标注 Almost@126.526.0未报告未报告20.3
Toolathlon-Verified官方报告值76.973.678.4未报告未报告
Agents’ Last Exam官方报告值31.627.626.3未报告31.8
CyberGym官方报告值94.095.1未报告未报告88.1
OSWorld-Verified官方报告值82.080.8未报告未报告未报告

MiMo:采用最终模型卡表格。发布稿的 Live RL 训练终点为 Pro 72.6 / Flash 65.7,与此处 71.9 / 67.9 不同;来源未在简表中解释全部配置差异,不混用两组结果。技术报告将最终表列在后续蒸馏章节,未完整给出逐项预算;CyberGym 还修正了部分环境,跨模型差值不作为选型结论。

DeepSeek:官方 instruct 表使用 effort=100、temperature=1、top_p=0.95;代码任务主要使用 DeepSeek Harness Minimal,DeepSWE 使用 mini-SWE。最大推理预算不代表日常低延迟表现。

MiMo 技术报告(§5.2 / 表 3) ↗ · 版本边界:不拼接 AA 不同版本的指数,也不混排 GDPval-AA v2 与 2.1。AutomationBench 的版本标注不同,本轮不纳入同名对照。

这八项基准各自能说明什么?

DeepSWE v1.1:修复真实代码仓库;跨厂商 harness 与预算未统一,不按差值判胜负。

Terminal-Bench 2.1:在终端完成工程任务;模型之外,命令工具与执行环境同样影响结果。

Terminal-Bench 4.0:保留题集版本,不把 2.1 的高分移到 4.0;未报告不等于零分。

ProgramBench:长程程序构建;MiMo 简表未逐项标注计分口径,仅并列披露,不做严格横比。

Toolathlon-Verified:多工具协作;不要混入未注明 Verified 的旧版成绩。

Agents’ Last Exam:困难长程任务;同名不保证题集快照、工具与预算完全一致。

CyberGym:MiMo 报告注明修正了部分评测环境;跨厂商不能直接比较,也不能外推为真实系统攻防成功率。

OSWorld-Verified:电脑界面操作;测试环境成功率不保证任意应用都可靠。

GLM FLASH / FLASHX / DEEPSEEK

FlashX 增加的是速度证据,能力仍需单独验证。

GLM-5.3-Flash

已有代码与工具评测。国际 API 每百万 token:未缓存输入 $0.15、缓存输入 $0.03、输出 $0.50。

已进入 Coding Plan,官方额度约为 GLM-5.3 的 3 倍;套餐额度不能换算为每项任务费用。

GLM-5.3-FlashX

官方标称 200 tokens/s。对应输入 $0.37、缓存输入 $0.075、输出 $1.25;输出单价为 Flash 的 2.5 倍。

当前未进入 Coding Plan。没有独立成绩不等于能力相同;输出速度也不等于整个任务快同样倍数。

DeepSeek-V4.1-Flash

原生视觉与长程 Agent 是本轮重点,公开结果已加入上表。API 当前使用 deepseek-flash。

优势信号来自高预算测试;需在相同工具和时限下测延迟与费用,不能仅凭 Flash 名称判断性价比。

判断置信度:型号、公开数值与来源对应关系为高;实际任务适配为中,需实测;跨厂商严格排名证据不足。

往期专题 · GLM-5.3 与 V4 Pro 等(2026-08 快照)
GLM-5.3-FLASH · 2026.08.26

高频开发更划算,难题仍该用 5.3。

它是 320B 总参数、18B 激活参数的原生多模态模型,支持 1M 上下文。官方称 Coding Plan 可用额度约为 GLM-5.3 的 3 倍;在 8 个同名代码与 Agent 基准中,Flash 有 3 项领先、5 项落后。

57AA Index v4.1.1$0.045折后每任务成本18B / 320B激活 / 总参数1M上下文窗口
优势

高频开发的性价比默认项

Toolathlon 78.4%、GDPval-AA 1773,且套餐可用额度更高;适合读代码、常规修改、测试修复和多轮迭代。

劣势 / 风险

最难的长程任务仍有差距

相对 GLM-5.3,HLE w/ Tools 低 7.2 分,Terminal-Bench 2.1 低 3.9 分;关键架构决策不应只为省额度而降档。

证据边界

大部分仍是厂商发布表

AA 指数和 GDPval-AA 属第三方评测;其余多数由智谱按披露设置运行,尚不能视为独立复测。

同名基准直比

Flash 与 GLM-5.3:不是全面降级,也不是全面替代。

两张官方发布表使用同名基准与相近脚注设置,可观察方向;但它们不是同一时间、同一实验批次的盲测,微小差距不要过度解读。

GLM-5.3-Flash 与 GLM-5.3 的同名官方基准对比
基准5.3 Flash5.3差值解读
Terminal-Bench 2.1Accuracy84.3%88.2%Flash −3.9旗舰在复杂终端工程上仍更稳。
DeepSWE v1.1Resolved63.4%66.9%Flash −3.5真实仓库修复接近,但旗舰保留优势。
NL2RepoScore56.3%58.0%Flash −1.7整仓生成差距较小。
Toolathlon VerifiedPass@178.4%73.0%Flash +5.4Flash 在该多工具基准反而领先。
AutomationBench v1.0.6Pass rate48.8%48.2%Flash +0.6几乎持平,不能据此宣称稳定领先。
Agents' Last ExamOfficial score26.3%28.5%Flash −2.2高难长程 CLI 任务仍偏旗舰。
HLE w/ ToolsOfficial score55.3%62.5%Flash −7.2工具增强的高难研究题是最大公开差距。
GDPval-AA v2Elo17731769Flash +4 EloElo 差距极小,应视为同一水平带。
16 个已披露指标 · 官方设置逐项标注

分数只回答对应任务,不平均成“模型智商”。

查看官方发布页 ↗
综合参考5.3 Flash

AA Intelligence Index v4.1.1

57Index

Artificial Analysis 的统一组合指数;不是百分制,也不是网站自定义总分。

$0.045 / task(折后)
编程与软件工程5.3 Flash

Z.ai Code Bench v1.0

29.0Internal score · Max

智谱私有编程评测,使用 Claude Code 2.1.207;污染风险较低,但外部无法完整复测。

Opus 4.8:29.5
Agent 与终端工程5.3 Flash

Terminal-Bench 2.1

84.3%Accuracy

在终端环境完成多步工程任务;使用 Claude Code 2.1.207、最多 65,536 输出 token、6 小时超时。

GLM-5.2:81.0%
编程与软件工程5.3 Flash

DeepSWE v1.1

63.4%Resolved

用 mini-swe-agent 修复真实代码任务;400K 上下文、单任务最长 6 小时。

GLM-5.2:46.2%
编程与软件工程5.3 Flash

NL2Repo

56.3%Score

从自然语言需求生成完整代码仓库;使用 1M 上下文与规则加模型双重判定。

GLM-5.2:48.9%
Agent 与工具使用5.3 Flash

Toolathlon Verified

78.4%Pass@1 · 3-run avg

多工具长链路任务;结果来自官方评测服务并取三次独立运行平均。

GLM-5.2:59.9%
Agent 与工具使用5.3 Flash

AutomationBench v1.0.6

48.8%Pass rate

自动化业务工作流任务;采用修复 null 类型处理问题后的 v1.0.6。

GLM-5.2:26.2%
Agent 与工具使用5.3 Flash

Agents' Last Exam

26.3%Official score

105 个高难 CLI 任务;Claude Code、Max、1M 上下文,关闭 Tool Search。

GLM-5.2:20.4%
搜索与深度研究5.3 Flash

HLE w/ Tools

55.3%Official score

允许工具的前沿知识题;使用上下文管理,评分器为 GPT-5.6 Luna(medium)。

GLM-5.2:54.7%
Agent 与知识工作5.3 Flash

GDPval-AA v2

1773Elo

真实专业工作任务的相对强度;由 Artificial Analysis 评测,Elo 不是百分比。

GLM-5.2:1504
视觉与文档理解5.3 Flash

OfficeQA Pro

62.4%Accuracy

不给嵌入文本访问,仅基于 PDF 内容完成任务,检验文档视觉理解与信息提取。

Opus 4.8:48.9%
视觉与图表推理5.3 Flash

CharXiv Reasoning w/ Tools

89.4%Accuracy

阅读科学图表并结合工具推理;视觉输入和工具链共同影响结果。

Opus 4.8:89.9%
视觉与图表推理5.3 Flash

Chartography w/ Tools

78.0%Accuracy

对复杂图表进行视觉读取和推理;使用 256K 最大上下文。

Opus 4.8:75.0%
视觉与多模态5.3 Flash

BabyVision

53.4%Accuracy

基础视觉理解与推理;输入图像短边至少缩放到 1.5K 像素。

Opus 4.8:46.8%
视频理解5.3 Flash

MVBench

77.8%Accuracy

视频理解评测;非原生视频模型采用每秒 1 帧抽取,输入策略会影响可比性。

Opus 4.8:67.1%
视频理解5.3 Flash

MMVU

80.5%Accuracy

多模态视频理解;帧抽取和最大帧数限制属于评测系统的一部分。

Opus 4.8:67.4%

数据基线为 2026-08-26。除 AA Intelligence Index 与 GDPval-AA v2 外,多数结果来自智谱发布材料中的自报评测;所有结果都属于“模型 + 推理档位 + Agent harness + 工具 + 时间预算”的系统表现。

PREVIOUS SNAPSHOT · 2026.08.13

上一期:DeepSeek V4 Pro、Claude 与 GPT‑5.6。

这里选择 DeepSeek V4 Pro 的 Max 推理档位,和 GPT-5.6 Sol、Claude Fable 5 的官方高能力配置对照。表中只展示来源确实报告过的分数;“未报告”和“版本不同”是数据状态,不是模型得零分。

DeepSeek V4 Pro Max、Claude Fable 5、GPT-5.6 Sol 的同维度对比
能力维度 / 基准DeepSeek V4 Pro MaxClaude Fable 5GPT-5.6 Sol
综合参考Artificial Analysis Intelligence Index v4.1.1Index(越高越好)45Max;AA 独立测评Artificial Analysis V4 Pro ↗60Fable 5;含 Opus 4.8 fallbackArtificial Analysis Fable 5 ↗59Sol;AA 独立测评Artificial Analysis GPT-5.6 Sol ↗
知识与科学推理GPQA DiamondPass@1(%)90.1%Pro Max;官方模型卡DeepSeek 官方模型卡 ↗92.6%Fable 5;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗94.6%Sol;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗
编程与软件工程SWE-bench ProResolved(%)55.4%Pro Max;官方模型卡DeepSeek 官方模型卡 ↗80.0%Fable 5;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗64.6%Sol;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗
Agent 与知识工作GDPval-AA v2Elo(越高越好)1554Pro Max;官方模型卡DeepSeek 官方模型卡 ↗1759.6Fable 5;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗1747.8Sol;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗
搜索与深度研究BrowseCompPass@1(%)83.4%Pro Max;官方模型卡DeepSeek 官方模型卡 ↗未报告Fable 5;当前来源未给同口径分数OpenAI GPT-5.6 发布表 ↗90.4%Sol;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗
Agent 与工具使用ToolathlonPass@1(%)51.8%Pro Max;官方模型卡DeepSeek 官方模型卡 ↗61.7%Fable 5;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗58.0%Sol;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗
视觉与多模态MMMU Pro(no tools)Accuracy(%)不支持V4 Pro 当前模型卡为 text-onlyArtificial Analysis V4 Pro 规格 ↗未报告Fable 5;当前来源未给同口径分数OpenAI GPT-5.6 发布表 ↗83.0%Sol;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗
数学与抽象推理FrontierMath Tier 1–3 v2Accuracy(%)未报告V4 Pro Max;模型卡未列该题集DeepSeek 官方模型卡 ↗87.0%Fable 5;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗89.0%Sol;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗
安全、事实性与稳健性HealthBench ProfessionalRubric score(%)未报告V4 Pro;模型卡未列该题集DeepSeek 官方模型卡 ↗60.9%Fable 5;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗60.5%Sol;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗
指令遵循与可靠性IFBench未统一公开未报告DeepSeek 官方模型卡未列分项DeepSeek 官方模型卡 ↗未报告公开对比表未列分项Artificial Analysis Fable 5 ↗未报告公开对比表未列分项Artificial Analysis GPT-5.6 Sol ↗
人类偏好与产品体验Arena / Chatbot Arena相对偏好分未报告未找到同口径官方结果DeepSeek 官方模型卡 ↗未报告未找到同口径官方结果Anthropic Fable 5 发布页 ↗未报告未找到同口径官方结果OpenAI GPT-5.6 发布页 ↗
长上下文与记忆上下文窗口规格最大输入 + 输出容量1M tokensV4 Pro;官方模型卡DeepSeek 官方模型卡 ↗1M tokensFable 5;Artificial Analysis 规格Artificial Analysis Fable 5 ↗1M tokensSol;Artificial Analysis 规格Artificial Analysis GPT-5.6 Sol ↗
Agent 与终端工程Terminal-Bench(版本不同)Accuracy(%)67.9%Terminal-Bench 2.0;Pro MaxDeepSeek 官方模型卡 ↗83.1%Terminal-Bench 2.1;Fable 5OpenAI GPT-5.6 发布表 ↗88.8%Terminal-Bench 2.1;SolOpenAI GPT-5.6 发布表 ↗
Artificial Analysis Intelligence Index v4.1.1

用统一评测组合观察知识、科学推理、编码、Agent 与长上下文等综合表现。

这是独立机构的组合指数,不是百分制,也不应替代分项评测。
GPQA Diamond

专家级 STEM 题有明确答案,能观察知识深度与多步推理。

三列都报告了该基准,但来源、运行时间和 harness 不完全相同。
SWE-bench Pro

检查模型能否读懂真实代码库、修改多文件并通过回归测试。

结果属于模型加 Agent harness 的系统;不能当作裸模型编程分。
GDPval-AA v2

用真实专业工作任务的成对比较,观察端到端产出质量。

Elo 是相对强度,不是百分比;对手池和评分流程会影响数值。
BrowseComp

需要改写查询、跨网页检索和证据拼接,适合观察研究型搜索。

OpenAI 当前发布表未列 Fable 5 的 BrowseComp 分数,不用 Opus 4.8 代填。
Toolathlon

多工具、多步骤任务能检验规划、调用、状态跟踪与恢复。

工具权限与 Agent 外壳会显著改变结果,分数不等于模型单体能力。
MMMU Pro(no tools)

图表、示意图与专业知识联合推理,能观察视觉输入是否真正参与答案。

DeepSeek V4 Pro 官方模型卡标注为文本输入;Fable 5 在该发布表中未报告。
FrontierMath Tier 1–3 v2

原创高难数学题能观察多步推导和前沿推理上限。

OpenAI 发布表给出 GPT 与 Fable 分数;DeepSeek 官方模型卡未报告同一题集结果。
HealthBench Professional

医生 rubric 将医疗回答拆成准确性、完整性、风险与沟通质量。

DeepSeek 官方模型卡没有报告该医疗评测;缺失不等于零分。
IFBench

自动检查复杂指令约束,适合观察格式、条件和多条要求的遵循。

当前三方公开来源只说明将其纳入部分综合指数,没有公开同口径分项值。
Arena / Chatbot Arena

匿名成对盲测更接近真实用户对开放式回答的综合选择。

当前采用的官方模型卡和发布表没有同一 Arena 版本、日期与投票池结果。
上下文窗口规格

窗口容量是使用长文档的前提,但不是长上下文理解能力得分。

三者规格均为约 1M tokens;不要把容量当作 MRCR、LongBench 等任务得分。
Terminal-Bench(版本不同)

终端任务检查模型是否能在真实计算机环境中完成多步操作。

DeepSeek 报告的是 2.0,GPT 与 Claude 报告的是 2.1;仅作背景,禁止横向排名。
DEEPSEEK V4 PRO · OFFICIAL MODEL CARD

V4 Pro Max 的分项成绩,不只是一张榜单截图。

查看原始模型卡 ↗
知识与专业推理Pro Max

MMLU-Pro

87.5%EM

跨学科研究生级选择题,观察知识调用与多步推理。

知识与事实性Pro Max

SimpleQA-Verified

57.9%Pass@1

短事实问答,区分答对、答错和不作答。

知识与事实性Pro Max

Chinese-SimpleQA

84.4%Pass@1

中文短事实问答,观察中文知识覆盖与事实可靠性。

知识与科学推理Pro Max

GPQA Diamond

90.1%Pass@1

专家级生物、物理、化学题,测试高难科学推理。

知识与前沿推理Pro Max

Humanity's Last Exam

37.7%Pass@1

跨学科专家题,难度高且更接近前沿知识边界。

编程与算法Pro Max

LiveCodeBench

93.5%Pass@1

时间切分的竞赛编程题,用隐藏测试验证代码是否真正通过。

编程与算法Pro Max

Codeforces

3206Rating

根据竞赛题解题表现拟合 Elo 级别,反映算法竞赛强度。

数学推理Pro Max

HMMT 2026 Feb

95.2%Pass@1

竞赛数学题,观察连续推导、计算与结果自检。

数学推理Pro Max

IMOAnswerBench

89.8%Pass@1

国际数学奥赛风格题,偏重证明与复杂推理链。

数学与抽象推理Pro Max

Apex

38.3%Pass@1

高难度原创数学与科学推理任务,区分前沿模型上限。

数学与抽象推理Pro Max

Apex Shortlist

90.2%Pass@1

Apex 的精选难题子集,减少长尾噪声后观察高难推理上限。

长上下文与记忆Pro Max

MRCR 1M

83.5%MMR

在百万 token 长文本中检索并综合多个关键线索。

长上下文与记忆Pro Max

CorpusQA 1M

62.0%Accuracy

在百万 token 语料中进行跨材料问答与推理。

Agent 与工具使用Pro Max

Terminal-Bench 2.0

67.9%Accuracy

在终端环境完成编译、调试和系统操作,检查最终状态。

编程与软件工程Pro Max

SWE-bench Verified

80.6%Resolved

修复真实代码库 issue,并通过指定回归测试。

编程与软件工程Pro Max

SWE-bench Pro

55.4%Resolved

更长、更复杂的真实软件工程任务,强调跨文件修改和验证。

编程与软件工程Pro Max

SWE Multilingual

76.2%Resolved

多语言代码库工程任务,观察跨语言 issue 理解与修复。

搜索与深度研究Pro Max

BrowseComp

83.4%Pass@1

多跳搜索公开网页,拼接难检索但可核验的最终答案。

搜索与深度研究Pro Max

HLE w/ tools

48.2%Pass@1

允许工具的 Humanity's Last Exam,观察搜索和工具是否提升前沿题表现。

Agent 与知识工作Pro Max

GDPval-AA v2

1554Elo

模拟真实专业工作任务,用成对比较拟合工作产出强度。

Agent 与工具使用Pro Max

MCPAtlas Public

73.6%Pass@1

在工具调用任务中规划、调用 MCP 并完成最终目标。

Agent 与工具使用Pro Max

Toolathlon

51.8%Pass@1

长链路、多工具任务,观察工具选择、状态跟踪和恢复。

以上为官方模型卡中的 Pro Max 结果;不同项目仍可能使用不同题集、工具和内部 harness。分数只能解释对应任务,不应平均成自定义总分。

推理档位敏感性

同一个 V4 Pro,换推理预算就会换一张成绩单。

Non-think、High、Max 不是三个不同模型,而是不同的测试时计算预算。Max 的高分不能直接代表日常低延迟调用的默认表现。

DeepSeek V4 Pro 在三档 reasoning effort 下的官方对照
基准Non-thinkHighMax解读
MMLU-ProEM82.9%87.1%87.5%知识题在 High/Max 档明显受益于更大推理预算。
GPQA DiamondPass@172.9%89.1%90.1%科学推理对推理档位非常敏感。
LiveCodeBenchPass@156.8%89.8%93.5%算法编程的分差主要反映思考时间和自检机会。
SWE-bench VerifiedResolved73.6%79.4%80.6%这是模型、Agent harness、工具和预算的系统结果。
MRCR 1MMMR44.7%83.3%83.5%百万 token 长上下文的有效利用不等于只有窗口容量。
BrowseCompPass@1未报告80.4%83.4%搜索任务需要工具;Non-think 没有同口径结果。
ToolathlonPass@146.3%49.0%51.8%多工具链路随推理预算增加而提升,但仍不是裸模型分。
06 / 模型档案

跟踪模型系列,但不追着传言填分。

每次新模型发布,先登记官方型号、日期和评测配置,再把分数映射到能力维度。 本轮更新五个型号;其他系列保留原收录日期,不代表当前完整发布状态。

Xiaomi / 小米

MiMo-V2.6-Pro

已发布 · 开放权重

长程工程 · 全模态 · 1M 上下文

官方模型卡:1.02T 总参数、42B 激活参数;DeepSWE v1.1 为 71.9。可列入复杂工程候选,仍需核对工具配置与任务成本。开放检查点名为 MiMo-V2.6-Pro-RL,不将 API 与本地部署表现视为完全一致。

查看官方来源 ↗
07 / 截图排雷

一张榜单出现这些信号,
先别急着转发。

单个问题不一定推翻结果,但红旗越多,结论的可信度越低。

高:官方方法 + 可复核 中:设置明确,待独立复测 低:截图或二手转述
01

只给总分,不给分项

无法判断优势来自知识、工具还是某一类题。

02

只写模型名,不写版本

同系列不同日期、推理档位和产品路由可能不是同一个系统。

03

混用 Pass@1 与 Pass@k

多次尝试的最好结果,不能冒充第一次成功率。

04

忽略 Agent harness

KimiCode、Claude Code、Codex 或自研 Agent 会改变工具、提示和恢复策略。

05

没有置信区间或样本量

小题集的几分差距,可能只是抽样和随机性。

06

厂商分数当独立结论

官方结果可以作为一手材料,但仍需看设置、复测与失败样本。

07

只看能力,不看成本

更高推理预算、多 Agent 和更多采样,可能用数倍成本换来几分。

08

公开旧题仍当新鲜证据

训练污染和 benchmark saturation 会让分数失去区分度。

最终判断

最好的模型,不是榜单第一;是与你的任务最匹配。

你的真实任务→对应能力维度→可信基准组合→小规模实测

用公开基准筛掉明显不合适的模型,再用自己的 20–100 个真实任务做最终选择。公开分数是地图,不是目的地。