测的到底是什么?
先把“智能”拆成知识、推理、编码、Agent、视觉、长上下文等可观察能力。
从 Kimi K3 到 GPT、GLM、DeepSeek,把每个 Benchmark 拆成三件事:测什么、怎么计分、能说明什么。
同一个模型,只要换了提示词、工具权限、重试次数或 Agent 框架,分数就可能不是同一件事。
评测的本质不是给模型贴一个“聪明”标签,而是用受控任务观察一类行为。 只有测试对象、评分规则和执行条件都清楚,数字才有解释力。
先把“智能”拆成知识、推理、编码、Agent、视觉、长上下文等可观察能力。
看清 Accuracy、Pass@1、Judge Score 或 Arena Score,不把不同单位硬凑成总分。
核对模型版本、推理档位、工具、Agent harness、采样次数、时间和成本预算。
每个基准都只有有限外推范围;高分不是“全能”,更不是你的场景必然更好用。
官方说明 K3 结果使用最高 reasoning effort。
KimiCode、Claude Code、Codex 按不同项目混用。
多模态等项目会取多次运行平均,ZeroBench 运行五次。
MCP Atlas 使用 Gemini 3.1 Pro 判断任务结果。
这些结果能说明 Kimi K3 在指定系统配置下的表现,但如果两行使用不同外壳、预算或评分器,就不能把分差全部归因于底层模型。
每个维度回答一个不同的问题。点击下方基准词典,继续查看它们如何被测量。
跨学科知识、研究生级科学推理、事实准确性与置信度校准。
竞赛数学、符号运算、组合推理、全新视觉规律归纳。
算法实现、仓库理解、跨文件修改、测试通过、终端操作。
多步规划、API 调用、状态跟踪、业务规则遵守与交付质量。
查询改写、多跳搜索、来源判断、持续探索和证据拼接。
图表、示意图、照片、扫描件、页面布局与跨模态推理。
跨文档问答、长对话、代码仓库、结构化数据和关键信息检索。
格式约束、关键词、长度、优先级、多轮一致性和拒答边界。
综合可用性、表达、风格、帮助程度,以及前端与设计成品偏好。
幻觉、越狱、过度拒答、偏见、健康建议与双重用途风险。
Accuracy 是答对比例,Pass@k 是给多次机会后的成功率,Arena Score 则是相对偏好。先认单位,才有资格比较。
正确题数 ÷ 总题数
题目难度、随机猜中率和题集版本不同,百分比不能跨基准直接比。
完全匹配记 1,否则记 0
严格但可能错杀语义等价答案;必须说明是否做格式归一化。
首个样本通过全部检查的任务比例
温度、提示词和是否允许重试都会影响结果。
k 个样本中至少一个通过
k 越大分越高,同时成本也更高,不能与 Pass@1 混读。
通过目标与回归测试的任务比例
测试本身可能有缺陷;结果属于整个 Agent 系统。
rubric 分项判定后聚合
必须公开评分器版本、rubric、顺序偏差和人工复核方式。
成对胜负拟合相对强度
不是百分制;对手池和投票分布变化,分数也会漂移。
首版收录最常出现在前沿模型发布材料里的代表性评测。 每张卡都回答:测什么、怎么计分、为什么有效、不能说明什么。
覆盖多学科的 10 选 1 难题,比原版 MMLU 更强调推理、降低猜中概率。
Massive Multitask Language Understanding Pro
由生物、物理、化学专家编写的研究生级多选题,Diamond 是最难且验证更严格的子集。
Graduate-Level Google-Proof Q&A — Diamond
跨上百个学科的专家级短答与选择题,包含多模态题目。
Humanity’s Last Exam (HLE)
答案为 000–999 整数的竞赛数学题,覆盖代数、几何、数论与组合。
American Invitational Mathematics Examination
观察少量彩色网格示例,归纳此前未见的变换规则并生成正确输出。
Abstraction and Reasoning Corpus 2
由数学家创作、部分达到研究前沿难度的原创题,题目尽量保持私有。
FrontierMath
按时间持续收集新发布的竞赛编程题,用隐藏测试验证生成代码。
LiveCodeBench
给模型真实 GitHub issue 和代码库,让 Agent 修改代码并通过回归测试。
Software Engineering Benchmark
在隔离终端中完成编译、调试、数据处理、系统配置等复杂任务。
Terminal-Bench
需要搜索、代码、文件理解和多步推理才能回答的真实助理任务,分三个难度等级。
General AI Assistants
在航空、零售等模拟业务里,多轮对话并调用 API,同时遵守业务规则。
Tool-Agent-User Interaction Benchmark
在公开网页中寻找难以检索、需要多跳拼接的单一短答案。
Browsing Competition
用图表、示意图、地图、乐谱、化学结构等完成大学级跨学科问题。
Massive Multi-discipline Multimodal Understanding Pro
在 8K 到 2M 词的文档、对话、代码库和结构化数据中理解并推理。
LongBench v2
把一条关键信息埋进不同长度、不同位置的长文本,再要求模型找回。
Needle In A Haystack
要求输出满足可自动检查的约束,如字数、关键词、格式或特定结构。
Instruction-Following Evaluation
同一真实用户问题由两个匿名模型回答,用户盲选更好的一个或判平。
Chatbot Arena / Arena
用答案明确、时间稳定的短事实题检查正确回答、错误回答与拒答。
SimpleQA
由医生编写真实医疗对话场景与细粒度 rubric,评估有用性、准确性与安全性。
HealthBench
每次新模型发布,先登记官方型号、日期和评测配置,再把分数映射到能力维度。 GPT-6 这类尚无正式来源的名字,只保留观察位。
Moonshot AI
编码 Agent · 生产力 · 多模态 · 长上下文
官方表格混用 KimiCode、Claude Code、Codex 等 harness。官方说明 K3 结果使用 max reasoning;跨模型比较时必须逐行核对执行环境。
查看官方来源 ↗单个问题不一定推翻结果,但红旗越多,结论的可信度越低。
无法判断优势来自知识、工具还是某一类题。
同系列不同日期、推理档位和产品路由可能不是同一个系统。
多次尝试的最好结果,不能冒充第一次成功率。
KimiCode、Claude Code、Codex 或自研 Agent 会改变工具、提示和恢复策略。
小题集的几分差距,可能只是抽样和随机性。
官方结果可以作为一手材料,但仍需看设置、复测与失败样本。
更高推理预算、多 Agent 和更多采样,可能用数倍成本换来几分。
训练污染和 benchmark saturation 会让分数失去区分度。
用公开基准筛掉明显不合适的模型,再用自己的 20–100 个真实任务做最终选择。公开分数是地图,不是目的地。