测的到底是什么?
先把“智能”拆成知识、推理、编码、Agent、视觉、长上下文等可观察能力。
以 MiMo V2.6 Pro / Flash 为最新案例,把每个 Benchmark 拆成三件事:测什么、怎么计分、能说明什么。
同一个模型,只要换了提示词、工具权限、重试次数或 Agent 框架,分数就可能不是同一件事。
评测的本质不是给模型贴一个“聪明”标签,而是用受控任务观察一类行为。 只有测试对象、评分规则和执行条件都清楚,数字才有解释力。
先把“智能”拆成知识、推理、编码、Agent、视觉、长上下文等可观察能力。
看清 Accuracy、Pass@1、Judge Score 或 Arena Score,不把不同单位硬凑成总分。
核对模型版本、推理档位、工具、Agent harness、采样次数、时间和成本预算。
每个基准都只有有限外推范围;高分不是“全能”,更不是你的场景必然更好用。
DeepSWE v1.1,官方模型卡结果;观察修改能否通过任务验证。
Terminal-Bench 2.1;不能与 4.0 版直接比较。
OSWorld-Verified;衡量测试环境中的 GUI 任务完成情况。
Agents’ Last Exam;高难任务仍有明显改进空间。
MiMo 系列值得进入工程与电脑操作任务的候选集。Pro 并非每项都领先 Flash;分数属于模型与工具共同完成的系统表现。这里展示厂商报告,未进行本站独立复测,也不生成综合排名。
每个维度回答一个不同的问题。点击下方基准词典,继续查看它们如何被测量。
跨学科知识、研究生级科学推理、事实准确性与置信度校准。
竞赛数学、符号运算、组合推理、全新视觉规律归纳。
算法实现、仓库理解、跨文件修改、测试通过、终端操作。
多步规划、API 调用、状态跟踪、业务规则遵守与交付质量。
查询改写、多跳搜索、来源判断、持续探索和证据拼接。
图表、示意图、照片、扫描件、页面布局与跨模态推理。
跨文档问答、长对话、代码仓库、结构化数据和关键信息检索。
格式约束、关键词、长度、优先级、多轮一致性和拒答边界。
综合可用性、表达、风格、帮助程度,以及前端与设计成品偏好。
幻觉、越狱、过度拒答、偏见、健康建议与双重用途风险。
Accuracy 是答对比例,Pass@k 是给多次机会后的成功率,Arena Score 则是相对偏好。先认单位,才有资格比较。
正确题数 ÷ 总题数
就像上学时的卷面分:100 道题答对 87 道,就是 87 分。
题目难度、随机猜中率和题集版本不同,百分比不能跨基准直接比。
完全匹配记 1,否则记 0
答案必须一字不差才算对;意思对了但写法不同,也记零分。
严格但可能错杀语义等价答案;必须说明是否做格式归一化。
首个样本通过全部检查的任务比例
只承认第一次交的答卷,相当于不许涂改、不许重考。
温度、提示词和是否允许重试都会影响结果。
k 个样本中至少一个通过
给好几次机会,只要中一次就算过;机会越多分越高,也越费钱。
k 越大分越高,同时成本也更高,不能与 Pass@1 混读。
通过目标与回归测试的任务比例
不是答对题,而是把真实软件的毛病真的修好,并且回归测试全通过。
测试本身可能有缺陷;结果属于整个 Agent 系统。
rubric 分项判定后聚合
换一位阅卷老师按评分细则打分;老师不同,分数也可能不同。
必须公开评分器版本、rubric、顺序偏差和人工复核方式。
成对胜负拟合相对强度
像匿名盲测打分:两个作品摆一起让用户挑,赢得多声誉就高;对手换了分也会变。
不是百分制;对手池和投票分布变化,分数也会漂移。
首版收录最常出现在前沿模型发布材料里的代表性评测。 每张卡都回答:测什么、怎么计分、为什么有效、不能说明什么。
覆盖多学科的 10 选 1 难题,比原版 MMLU 更强调推理、降低猜中概率。
Massive Multitask Language Understanding Pro
人话给模型出一份几十个学科混在一起的加难高考卷,看它知识面广不广、稳不稳。
由生物、物理、化学专家编写的研究生级多选题,Diamond 是最难且验证更严格的子集。
Graduate-Level Google-Proof Q&A — Diamond
人话让模型做连研究生都会卡壳的理化生难题,看它是真懂还是背答案。
跨上百个学科的专家级短答与选择题,包含多模态题目。
Humanity’s Last Exam (HLE)
人话一份号称史上最难的百科大考,专门防止模型把老题库背熟后冒充满分。
答案为 000–999 整数的竞赛数学题,覆盖代数、几何、数论与组合。
American Invitational Mathematics Examination
人话让模型参加美国数学竞赛,答案是一个整数,没法用废话蒙混,考硬推导。
观察少量彩色网格示例,归纳此前未见的变换规则并生成正确输出。
Abstraction and Reasoning Corpus 2
人话给模型看几组找规律图形,让它自己总结规律再画出下一张,专考举一反三。
由数学家创作、部分达到研究前沿难度的原创题,题目尽量保持私有。
FrontierMath
人话数学家出的私房难题,网上搜不到,考的是研究级的数学创造力和精确度。
按时间持续收集新发布的竞赛编程题,用隐藏测试验证生成代码。
LiveCodeBench
人话让模型现场做编程题,写完直接跑测试,跑不过就是零分,考真功夫。
给模型真实 GitHub issue 和代码库,让 Agent 修改代码并通过回归测试。
Software Engineering Benchmark
人话把真实软件项目的报错工单甩给模型,要它钻进整个代码库把毛病修好。
在隔离终端中完成编译、调试、数据处理、系统配置等复杂任务。
Terminal-Bench
人话把模型丢进一台电脑里干活,装环境、跑命令、修错误,最后检查电脑状态对不对。
需要搜索、代码、文件理解和多步推理才能回答的真实助理任务,分三个难度等级。
General AI Assistants
人话给模型派真实助理任务,查资料、读文件、算数据,几步全做完才算通过。
在航空、零售等模拟业务里,多轮对话并调用 API,同时遵守业务规则。
Tool-Agent-User Interaction Benchmark
人话让模型扮演航空公司或电商客服,一边跟用户聊一边操作系统,还不能坏业务规矩。
在公开网页中寻找难以检索、需要多跳拼接的单一短答案。
Browsing Competition
人话出一个网上很难搜到的冷门问题,看模型能不能翻遍网页把唯一正确答案找出来。
用图表、示意图、地图、乐谱、化学结构等完成大学级跨学科问题。
Massive Multi-discipline Multimodal Understanding Pro
人话给模型看图表、乐谱、化学结构再提大学问题,考它是真看懂了还是在瞎猜。
在 8K 到 2M 词的文档、对话、代码库和结构化数据中理解并推理。
LongBench v2
人话塞给模型一部上百页的材料再提问,看它是不是真读完、还能串起来推理。
把一条关键信息埋进不同长度、不同位置的长文本,再要求模型找回。
Needle In A Haystack
人话在一本厚书里藏一句话,再考模型能不能找回来,测的是长文本的记性。
要求输出满足可自动检查的约束,如字数、关键词、格式或特定结构。
Instruction-Following Evaluation
人话给模型下硬要求,比如必须多少字、用什么格式,做不到就扣分,测听不听话。
同一真实用户问题由两个匿名模型回答,用户盲选更好的一个或判平。
Chatbot Arena / Arena
人话两个模型匿名回答同一个问题,真人盲选哪个好,像打分点评,比的是受欢迎程度。
用答案明确、时间稳定的短事实题检查正确回答、错误回答与拒答。
SimpleQA
人话问模型一堆有标准答案的小知识题,答错和老实说不知道分开记账,测它老不老实。
由医生编写真实医疗对话场景与细粒度 rubric,评估有用性、准确性与安全性。
HealthBench
人话让模型回答真实医疗咨询,由真医生按细则打分,考的是专业又安全的分寸感。
先看 MiMo V2.6 双模型,再对照 GLM Flash / FlashX 与 DeepSeek V4.1 Flash。各家自报成绩仅作证据对照,不是统一复测排名。
Pro 与 Flash 均支持原生多模态和 1M 上下文。Pro 可进入复杂工程候选;Flash 可进入高频任务候选。最终选择要一起测成功率、等待时间、重试与总费用。
以下为小米官方演示摘要,本站未独立复现。
官方展示了从需求到场景、交互与视觉检查的协作流程。
怎么看:验收要看能否完整游玩、操作是否正确;画面好看不代表逻辑可靠。
查看原始演示与说明 ↗官方展示 Pro 辅助材料计算筛选与 Lean 形式化证明。
怎么看:材料候选仍需实验;证明案例包含研究员引导和后续修订。
查看原始演示与说明 ↗官方展示了网页、幻灯片与科普视频等工具协作产物。
怎么看:这些是精选演示,未披露任务总体成功率;不能代表一次生成即可交付。
查看原始演示与说明 ↗数值为官方报告值,越高通常越好。跨厂商并非同一次实验,不能将小差距解释为稳定领先。FlashX 未找到单独评测表,留空而不借用 Flash 成绩。
| 基准与口径 | MiMo V2.6 Pro ↗ | MiMo V2.6 Flash ↗ | GLM-5.3 Flash ↗ | GLM-5.3 FlashX ↗ | DeepSeek V4.1 Flash ↗ |
|---|---|---|---|---|---|
| DeepSWE v1.1Resolved / 官方报告值 | 71.9 | 67.9 | 63.4 | 未报告 | 74.2 |
| Terminal-Bench 2.1任务通过率 / % | 89.9 | 87.6 | 84.3 | 未报告 | 90.6 |
| Terminal-Bench 4.0任务通过率 / % | 34.9 | 28.8 | 未报告 | 未报告 | 31.2 |
| ProgramBench官方报告值;DeepSeek 标注 Almost@1 | 26.5 | 26.0 | 未报告 | 未报告 | 20.3 |
| Toolathlon-Verified官方报告值 | 76.9 | 73.6 | 78.4 | 未报告 | 未报告 |
| Agents’ Last Exam官方报告值 | 31.6 | 27.6 | 26.3 | 未报告 | 31.8 |
| CyberGym官方报告值 | 94.0 | 95.1 | 未报告 | 未报告 | 88.1 |
| OSWorld-Verified官方报告值 | 82.0 | 80.8 | 未报告 | 未报告 | 未报告 |
MiMo:采用最终模型卡表格。发布稿的 Live RL 训练终点为 Pro 72.6 / Flash 65.7,与此处 71.9 / 67.9 不同;来源未在简表中解释全部配置差异,不混用两组结果。技术报告将最终表列在后续蒸馏章节,未完整给出逐项预算;CyberGym 还修正了部分环境,跨模型差值不作为选型结论。
DeepSeek:官方 instruct 表使用 effort=100、temperature=1、top_p=0.95;代码任务主要使用 DeepSeek Harness Minimal,DeepSWE 使用 mini-SWE。最大推理预算不代表日常低延迟表现。
MiMo 技术报告(§5.2 / 表 3) ↗ · 版本边界:不拼接 AA 不同版本的指数,也不混排 GDPval-AA v2 与 2.1。AutomationBench 的版本标注不同,本轮不纳入同名对照。
DeepSWE v1.1:修复真实代码仓库;跨厂商 harness 与预算未统一,不按差值判胜负。
Terminal-Bench 2.1:在终端完成工程任务;模型之外,命令工具与执行环境同样影响结果。
Terminal-Bench 4.0:保留题集版本,不把 2.1 的高分移到 4.0;未报告不等于零分。
ProgramBench:长程程序构建;MiMo 简表未逐项标注计分口径,仅并列披露,不做严格横比。
Toolathlon-Verified:多工具协作;不要混入未注明 Verified 的旧版成绩。
Agents’ Last Exam:困难长程任务;同名不保证题集快照、工具与预算完全一致。
CyberGym:MiMo 报告注明修正了部分评测环境;跨厂商不能直接比较,也不能外推为真实系统攻防成功率。
OSWorld-Verified:电脑界面操作;测试环境成功率不保证任意应用都可靠。
已有代码与工具评测。国际 API 每百万 token:未缓存输入 $0.15、缓存输入 $0.03、输出 $0.50。
已进入 Coding Plan,官方额度约为 GLM-5.3 的 3 倍;套餐额度不能换算为每项任务费用。
官方标称 200 tokens/s。对应输入 $0.37、缓存输入 $0.075、输出 $1.25;输出单价为 Flash 的 2.5 倍。
当前未进入 Coding Plan。没有独立成绩不等于能力相同;输出速度也不等于整个任务快同样倍数。
原生视觉与长程 Agent 是本轮重点,公开结果已加入上表。API 当前使用 deepseek-flash。
优势信号来自高预算测试;需在相同工具和时限下测延迟与费用,不能仅凭 Flash 名称判断性价比。
核对 2026-09-22 · GLM 官方规格 ↗ · Z.ai 美元定价 ↗ · DeepSeek 发布说明 ↗
判断置信度:型号、公开数值与来源对应关系为高;实际任务适配为中,需实测;跨厂商严格排名证据不足。
它是 320B 总参数、18B 激活参数的原生多模态模型,支持 1M 上下文。官方称 Coding Plan 可用额度约为 GLM-5.3 的 3 倍;在 8 个同名代码与 Agent 基准中,Flash 有 3 项领先、5 项落后。
Toolathlon 78.4%、GDPval-AA 1773,且套餐可用额度更高;适合读代码、常规修改、测试修复和多轮迭代。
相对 GLM-5.3,HLE w/ Tools 低 7.2 分,Terminal-Bench 2.1 低 3.9 分;关键架构决策不应只为省额度而降档。
AA 指数和 GDPval-AA 属第三方评测;其余多数由智谱按披露设置运行,尚不能视为独立复测。
两张官方发布表使用同名基准与相近脚注设置,可观察方向;但它们不是同一时间、同一实验批次的盲测,微小差距不要过度解读。
| 基准 | 5.3 Flash | 5.3 | 差值 | 解读 |
|---|---|---|---|---|
| Terminal-Bench 2.1Accuracy | 84.3% | 88.2% | Flash −3.9 | 旗舰在复杂终端工程上仍更稳。 |
| DeepSWE v1.1Resolved | 63.4% | 66.9% | Flash −3.5 | 真实仓库修复接近,但旗舰保留优势。 |
| NL2RepoScore | 56.3% | 58.0% | Flash −1.7 | 整仓生成差距较小。 |
| Toolathlon VerifiedPass@1 | 78.4% | 73.0% | Flash +5.4 | Flash 在该多工具基准反而领先。 |
| AutomationBench v1.0.6Pass rate | 48.8% | 48.2% | Flash +0.6 | 几乎持平,不能据此宣称稳定领先。 |
| Agents' Last ExamOfficial score | 26.3% | 28.5% | Flash −2.2 | 高难长程 CLI 任务仍偏旗舰。 |
| HLE w/ ToolsOfficial score | 55.3% | 62.5% | Flash −7.2 | 工具增强的高难研究题是最大公开差距。 |
| GDPval-AA v2Elo | 1773 | 1769 | Flash +4 Elo | Elo 差距极小,应视为同一水平带。 |
Artificial Analysis 的统一组合指数;不是百分制,也不是网站自定义总分。
$0.045 / task(折后)智谱私有编程评测,使用 Claude Code 2.1.207;污染风险较低,但外部无法完整复测。
Opus 4.8:29.5在终端环境完成多步工程任务;使用 Claude Code 2.1.207、最多 65,536 输出 token、6 小时超时。
GLM-5.2:81.0%用 mini-swe-agent 修复真实代码任务;400K 上下文、单任务最长 6 小时。
GLM-5.2:46.2%从自然语言需求生成完整代码仓库;使用 1M 上下文与规则加模型双重判定。
GLM-5.2:48.9%多工具长链路任务;结果来自官方评测服务并取三次独立运行平均。
GLM-5.2:59.9%自动化业务工作流任务;采用修复 null 类型处理问题后的 v1.0.6。
GLM-5.2:26.2%105 个高难 CLI 任务;Claude Code、Max、1M 上下文,关闭 Tool Search。
GLM-5.2:20.4%允许工具的前沿知识题;使用上下文管理,评分器为 GPT-5.6 Luna(medium)。
GLM-5.2:54.7%真实专业工作任务的相对强度;由 Artificial Analysis 评测,Elo 不是百分比。
GLM-5.2:1504不给嵌入文本访问,仅基于 PDF 内容完成任务,检验文档视觉理解与信息提取。
Opus 4.8:48.9%阅读科学图表并结合工具推理;视觉输入和工具链共同影响结果。
Opus 4.8:89.9%对复杂图表进行视觉读取和推理;使用 256K 最大上下文。
Opus 4.8:75.0%基础视觉理解与推理;输入图像短边至少缩放到 1.5K 像素。
Opus 4.8:46.8%视频理解评测;非原生视频模型采用每秒 1 帧抽取,输入策略会影响可比性。
Opus 4.8:67.1%多模态视频理解;帧抽取和最大帧数限制属于评测系统的一部分。
Opus 4.8:67.4%数据基线为 2026-08-26。除 AA Intelligence Index 与 GDPval-AA v2 外,多数结果来自智谱发布材料中的自报评测;所有结果都属于“模型 + 推理档位 + Agent harness + 工具 + 时间预算”的系统表现。
这里选择 DeepSeek V4 Pro 的 Max 推理档位,和 GPT-5.6 Sol、Claude Fable 5 的官方高能力配置对照。表中只展示来源确实报告过的分数;“未报告”和“版本不同”是数据状态,不是模型得零分。
| 能力维度 / 基准 | DeepSeek V4 Pro Max | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| 综合参考Artificial Analysis Intelligence Index v4.1.1Index(越高越好) | 45Max;AA 独立测评Artificial Analysis V4 Pro ↗ | 60Fable 5;含 Opus 4.8 fallbackArtificial Analysis Fable 5 ↗ | 59Sol;AA 独立测评Artificial Analysis GPT-5.6 Sol ↗ |
| 知识与科学推理GPQA DiamondPass@1(%) | 90.1%Pro Max;官方模型卡DeepSeek 官方模型卡 ↗ | 92.6%Fable 5;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗ | 94.6%Sol;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗ |
| 编程与软件工程SWE-bench ProResolved(%) | 55.4%Pro Max;官方模型卡DeepSeek 官方模型卡 ↗ | 80.0%Fable 5;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗ | 64.6%Sol;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗ |
| Agent 与知识工作GDPval-AA v2Elo(越高越好) | 1554Pro Max;官方模型卡DeepSeek 官方模型卡 ↗ | 1759.6Fable 5;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗ | 1747.8Sol;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗ |
| 搜索与深度研究BrowseCompPass@1(%) | 83.4%Pro Max;官方模型卡DeepSeek 官方模型卡 ↗ | 未报告Fable 5;当前来源未给同口径分数OpenAI GPT-5.6 发布表 ↗ | 90.4%Sol;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗ |
| Agent 与工具使用ToolathlonPass@1(%) | 51.8%Pro Max;官方模型卡DeepSeek 官方模型卡 ↗ | 61.7%Fable 5;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗ | 58.0%Sol;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗ |
| 视觉与多模态MMMU Pro(no tools)Accuracy(%) | 不支持V4 Pro 当前模型卡为 text-onlyArtificial Analysis V4 Pro 规格 ↗ | 未报告Fable 5;当前来源未给同口径分数OpenAI GPT-5.6 发布表 ↗ | 83.0%Sol;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗ |
| 数学与抽象推理FrontierMath Tier 1–3 v2Accuracy(%) | 未报告V4 Pro Max;模型卡未列该题集DeepSeek 官方模型卡 ↗ | 87.0%Fable 5;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗ | 89.0%Sol;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗ |
| 安全、事实性与稳健性HealthBench ProfessionalRubric score(%) | 未报告V4 Pro;模型卡未列该题集DeepSeek 官方模型卡 ↗ | 60.9%Fable 5;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗ | 60.5%Sol;OpenAI 发布表OpenAI GPT-5.6 发布表 ↗ |
| 指令遵循与可靠性IFBench未统一公开 | 未报告DeepSeek 官方模型卡未列分项DeepSeek 官方模型卡 ↗ | 未报告公开对比表未列分项Artificial Analysis Fable 5 ↗ | 未报告公开对比表未列分项Artificial Analysis GPT-5.6 Sol ↗ |
| 人类偏好与产品体验Arena / Chatbot Arena相对偏好分 | 未报告未找到同口径官方结果DeepSeek 官方模型卡 ↗ | 未报告未找到同口径官方结果Anthropic Fable 5 发布页 ↗ | 未报告未找到同口径官方结果OpenAI GPT-5.6 发布页 ↗ |
| 长上下文与记忆上下文窗口规格最大输入 + 输出容量 | 1M tokensV4 Pro;官方模型卡DeepSeek 官方模型卡 ↗ | 1M tokensFable 5;Artificial Analysis 规格Artificial Analysis Fable 5 ↗ | 1M tokensSol;Artificial Analysis 规格Artificial Analysis GPT-5.6 Sol ↗ |
| Agent 与终端工程Terminal-Bench(版本不同)Accuracy(%) | 67.9%Terminal-Bench 2.0;Pro MaxDeepSeek 官方模型卡 ↗ | 83.1%Terminal-Bench 2.1;Fable 5OpenAI GPT-5.6 发布表 ↗ | 88.8%Terminal-Bench 2.1;SolOpenAI GPT-5.6 发布表 ↗ |
用统一评测组合观察知识、科学推理、编码、Agent 与长上下文等综合表现。
这是独立机构的组合指数,不是百分制,也不应替代分项评测。专家级 STEM 题有明确答案,能观察知识深度与多步推理。
三列都报告了该基准,但来源、运行时间和 harness 不完全相同。检查模型能否读懂真实代码库、修改多文件并通过回归测试。
结果属于模型加 Agent harness 的系统;不能当作裸模型编程分。用真实专业工作任务的成对比较,观察端到端产出质量。
Elo 是相对强度,不是百分比;对手池和评分流程会影响数值。需要改写查询、跨网页检索和证据拼接,适合观察研究型搜索。
OpenAI 当前发布表未列 Fable 5 的 BrowseComp 分数,不用 Opus 4.8 代填。多工具、多步骤任务能检验规划、调用、状态跟踪与恢复。
工具权限与 Agent 外壳会显著改变结果,分数不等于模型单体能力。图表、示意图与专业知识联合推理,能观察视觉输入是否真正参与答案。
DeepSeek V4 Pro 官方模型卡标注为文本输入;Fable 5 在该发布表中未报告。原创高难数学题能观察多步推导和前沿推理上限。
OpenAI 发布表给出 GPT 与 Fable 分数;DeepSeek 官方模型卡未报告同一题集结果。医生 rubric 将医疗回答拆成准确性、完整性、风险与沟通质量。
DeepSeek 官方模型卡没有报告该医疗评测;缺失不等于零分。自动检查复杂指令约束,适合观察格式、条件和多条要求的遵循。
当前三方公开来源只说明将其纳入部分综合指数,没有公开同口径分项值。匿名成对盲测更接近真实用户对开放式回答的综合选择。
当前采用的官方模型卡和发布表没有同一 Arena 版本、日期与投票池结果。窗口容量是使用长文档的前提,但不是长上下文理解能力得分。
三者规格均为约 1M tokens;不要把容量当作 MRCR、LongBench 等任务得分。终端任务检查模型是否能在真实计算机环境中完成多步操作。
DeepSeek 报告的是 2.0,GPT 与 Claude 报告的是 2.1;仅作背景,禁止横向排名。跨学科研究生级选择题,观察知识调用与多步推理。
短事实问答,区分答对、答错和不作答。
中文短事实问答,观察中文知识覆盖与事实可靠性。
专家级生物、物理、化学题,测试高难科学推理。
跨学科专家题,难度高且更接近前沿知识边界。
时间切分的竞赛编程题,用隐藏测试验证代码是否真正通过。
根据竞赛题解题表现拟合 Elo 级别,反映算法竞赛强度。
竞赛数学题,观察连续推导、计算与结果自检。
国际数学奥赛风格题,偏重证明与复杂推理链。
高难度原创数学与科学推理任务,区分前沿模型上限。
Apex 的精选难题子集,减少长尾噪声后观察高难推理上限。
在百万 token 长文本中检索并综合多个关键线索。
在百万 token 语料中进行跨材料问答与推理。
在终端环境完成编译、调试和系统操作,检查最终状态。
修复真实代码库 issue,并通过指定回归测试。
更长、更复杂的真实软件工程任务,强调跨文件修改和验证。
多语言代码库工程任务,观察跨语言 issue 理解与修复。
多跳搜索公开网页,拼接难检索但可核验的最终答案。
允许工具的 Humanity's Last Exam,观察搜索和工具是否提升前沿题表现。
模拟真实专业工作任务,用成对比较拟合工作产出强度。
在工具调用任务中规划、调用 MCP 并完成最终目标。
长链路、多工具任务,观察工具选择、状态跟踪和恢复。
以上为官方模型卡中的 Pro Max 结果;不同项目仍可能使用不同题集、工具和内部 harness。分数只能解释对应任务,不应平均成自定义总分。
Non-think、High、Max 不是三个不同模型,而是不同的测试时计算预算。Max 的高分不能直接代表日常低延迟调用的默认表现。
| 基准 | Non-think | High | Max | 解读 |
|---|---|---|---|---|
| MMLU-ProEM | 82.9% | 87.1% | 87.5% | 知识题在 High/Max 档明显受益于更大推理预算。 |
| GPQA DiamondPass@1 | 72.9% | 89.1% | 90.1% | 科学推理对推理档位非常敏感。 |
| LiveCodeBenchPass@1 | 56.8% | 89.8% | 93.5% | 算法编程的分差主要反映思考时间和自检机会。 |
| SWE-bench VerifiedResolved | 73.6% | 79.4% | 80.6% | 这是模型、Agent harness、工具和预算的系统结果。 |
| MRCR 1MMMR | 44.7% | 83.3% | 83.5% | 百万 token 长上下文的有效利用不等于只有窗口容量。 |
| BrowseCompPass@1 | 未报告 | 80.4% | 83.4% | 搜索任务需要工具;Non-think 没有同口径结果。 |
| ToolathlonPass@1 | 46.3% | 49.0% | 51.8% | 多工具链路随推理预算增加而提升,但仍不是裸模型分。 |
每次新模型发布,先登记官方型号、日期和评测配置,再把分数映射到能力维度。 本轮更新五个型号;其他系列保留原收录日期,不代表当前完整发布状态。
Xiaomi / 小米
长程工程 · 全模态 · 1M 上下文
官方模型卡:1.02T 总参数、42B 激活参数;DeepSWE v1.1 为 71.9。可列入复杂工程候选,仍需核对工具配置与任务成本。开放检查点名为 MiMo-V2.6-Pro-RL,不将 API 与本地部署表现视为完全一致。
查看官方来源 ↗单个问题不一定推翻结果,但红旗越多,结论的可信度越低。
无法判断优势来自知识、工具还是某一类题。
同系列不同日期、推理档位和产品路由可能不是同一个系统。
多次尝试的最好结果,不能冒充第一次成功率。
KimiCode、Claude Code、Codex 或自研 Agent 会改变工具、提示和恢复策略。
小题集的几分差距,可能只是抽样和随机性。
官方结果可以作为一手材料,但仍需看设置、复测与失败样本。
更高推理预算、多 Agent 和更多采样,可能用数倍成本换来几分。
训练污染和 benchmark saturation 会让分数失去区分度。
用公开基准筛掉明显不合适的模型,再用自己的 20–100 个真实任务做最终选择。公开分数是地图,不是目的地。