AI Agent Benchmark Landscape · 2026-07

AI Agent 权威测试套全景图鉴
——按测试目标与领域分类,谁在测什么、为谁而测

本图鉴汇总 2023–2026 年学术界与工业界有影响力的 AI Agent 测试套,按「测试目标 × 领域」分为十大类,逐一回答四个问题:测什么、有哪些测试套、哪些场景在用、测试目的是什么。全部条目均来自本报告体系已核实的论文与官方资料(arXiv 编号可查),含已被官方弃用或证伪的基准并如实标注——选型时必须知道哪些分数还能信。

日期:2026 年 7 月 29 日 收录:30+ 测试套 / 10 大领域 原则:不编造 · 不夸大 · 弃用者如实标注 ← 返回主报告 基础设施瓶颈诊断 SWE-bench 调查 EdgeBench 调查 AA-AgentPerf 调查 MLPerf 调查 SWE-Universe 调查
10 大类
按测试目标划分:能力、性能、安全、记忆、学习、行业、元评测
807,693
最大环境供给规模:SWE-Universe 可验证环境数(52,960 仓库)
61,354
最强能效记录:GB300 NVL72 的 Agents per Megawatt
12–72h
最长单任务时程:EdgeBench 学习速率测量
9 / 10
BenchJack 审计:主流基准中可被「不解题刷分」的比例
1 个弃用
SWE-bench Verified:2026-02 被 OpenAI 官方停用,分数不可再引用
A 编码与软件工程 B 推理服务与硬件能效 C 长时程学习 D 工具与函数调用 E 计算机操作 GUI F 记忆与长上下文 G 安全与对抗 H 多智能体协作 I 垂直行业 J 评测基础设施
SLIDE 02 / 13 总览 MAP

一张表看懂:十大领域,各自在测什么The Landscape at a Glance

「AI Agent 基准」不是一类东西。有的测模型能力(能不能做对),有的测系统性能(单位资源能服务多少),有的测可信度(能不能防攻击、防作弊、防污染),还有的测评测本身(分数还可不可信)。下表是全图鉴的索引,后续每页展开一个领域。

领域测试目标(测什么)代表测试套(机构 · 年份)典型使用场景
A 编码与软件工程真实 issue 修复、终端操作、代码产物质量SWE-bench 家族(Princeton/OpenAI/Scale AI)、SWE-Universe(阿里 Qwen 2026)、Terminal-Bench(Stanford 2026)、ArtifactsBench(腾讯 2025)模型发版主战场、编码助手选型、训练环境工厂
B 推理服务与硬件能效固定服务水平下的容量、每兆瓦 Agent 数AA-AgentPerf(Artificial Analysis 2026)、MLPerf Agentic Inference(MLCommons 2026)数据中心采购、推理云容量规划、硬件厂商竞赛
C 长时程学习与自我进化环境交互中的学习速率(12–72 小时)EdgeBench(字节 Seed 2026,arXiv:2607.05155)模型代际追踪、学习动力学研究、长会话基建验收
D 工具与函数调用API 选择、参数生成、多轮工具-用户交互BFCL(UC Berkeley,V4 持续更新)、τ-bench / τ²-bench(Sierra 2024/2025)、ToolLLM(2023)函数调用模型选型、客服/订票类 Agent 验收
E 计算机操作(GUI/Web)真实操作系统与浏览器中的开放式任务OSWorld / OSWorld-Verified(xLang 2024/2025)、Windows Agent Arena(Microsoft 2024)、WebArena / VisualWebArena(CMU 2023/2024)桌面自动化、RPA、Computer-Use Agent 发版必测
F 记忆与长上下文跨会话长期记忆的保持、更新与拒答LongMemEval(ICLR 2025,1.5M token)、BEAM/LIGHT(2025,10M token)、LoCoMo(ACL 2024)、MemoryBank(AAAI 2024)记忆服务/个人助理产品的能力验收
G 安全与对抗注入攻击、有害行为、MCP 投毒、基准可破解性AgentDojo(ETH 2024)、AgentHarm(ICLR 2025)、HarmBench(ICML 2024)、CyberSecEval 3(Meta 2024)、MCPTox(AAAI 2026)、BenchJack(UC Berkeley 2026)上线前安全门禁、红队演练、基准可信度审计
H 多智能体协作协作失败模式、多任务干扰MAST(UC Berkeley 2025,14 种失败模式)、C³-Bench(腾讯 2025)多智能体框架设计与回归测试
I 垂直行业与职业金融/电商/语音外呼/研究报告的行业级交付质量FinSearchComp(字节 2025)、ReportBench(字节 2025)、EcomBench(阿里通义 2025)、VoiceAgentEval(声网×美团×xbench 2025)、BrowseComp(OpenAI 2025)、xbench(红杉中国)行业落地 POC 验收、职业技能对齐
J 评测基础设施与元评测评测的成本、过程质量、可复现性HAL(Princeton 2025)、Inspect / inspect_evals(UK AISI 2024/2025)、AgentProcessBench(2026)、CUARewardBench(腾讯优图 2025)评测平台建设、过程监督、奖励模型训练
读法选择测试套的第一步不是看「哪个有名」,而是先回答「我要测的对象是什么」——模型能力、推理系统、硬件栈、还是评测可信度本身。测错了对象,再高的分也不说明问题。
SLIDE 03 / 13 领域 A · CODING

A · 编码与软件工程:竞争最激烈、也最先「见顶」的战场Software Engineering Benchmarks

测什么:Agent 能否在真实代码库中定位问题、修改代码并通过隐藏测试——从单 issue 修复(SWE-bench)、终端操作(Terminal-Bench)到前端产物质量(ArtifactsBench)。这一领域同时包含「测能力」的榜单与「供给环境」的工厂(SWE-Universe)。测试目的:编码是 Agent 最先商业化的场景,分数直接决定模型发版叙事与 IDE 产品选型。警示:该领域也是污染与过拟合的重灾区——SWE-bench Verified 已被官方弃用,引用任何分数前请先核对基准状态。

SWE-bench(原版)
Princeton 等 · ICLR 2024 · arXiv:2310.06770
测:真实 issue 修复率
2,294
真实 GitHub issue
2024-06
转向 Docker 容器化评测
测试目的:检验「读 issue → 改代码 → 过测试」的端到端修复能力;评分依赖在隔离容器中执行仓库测试套件。
场景:一切编码模型的「入学考试」;轻量版 SWE-bench Lite(300 题)用于快速迭代。
SWE-bench Verified ⚠ 已弃用
OpenAI × SWE-bench 团队 · 2024-08 · 2026-02 官方停用
已弃用:分数不可再引用
500 题
人工筛选子集
59.4%
138 道最难题存在测试缺陷
100%
金补丁可被逐字复述(训练污染)
测试目的(原设计):过滤掉「环境搭建不可靠、测试与 issue 无关」的噪声题。弃用原因:审计发现测试缺陷 + 训练污染双重失效,OpenAI 2026-02-23 宣布停止报告其分数。
场景:历史对标 only。任何 2026 年后仍引用 Verified 分数的宣传都应打折。
SWE-bench Pro
Scale AI · 2025 · 官方榜单持续更新
测:抗污染工业级修复高区分度
1,865 题
41 个仓库
731/858/276
Public / Held-out / Commercial 三分法
~23–25%
前沿模型得分(低饱和)
测试目的:针对 Verified 的污染与饱和,以保留集+商业任务三分法保持长期区分度,任务链路更长、更贴近企业场景。
场景:当前编码模型横向对比的优先选择之一;企业选型参考。
SWE-Universe
阿里 Qwen 团队 × 浙江大学 · 2026-02 · arXiv:2602.02361
测+产:百万级环境工厂
807,693
可验证环境(52,960 仓库 / 8 类语言)
78.44%
Qwen-Next-80A3 构建成功率
33.3M
GitHub PR 筛选起点
测试目的:不只是一份榜单——用定制 MoE 自动合成 Docker 环境+验证脚本,把「可验证环境」从稀缺资源变成工业品,服务训练(RL)与评测双侧。
场景:模型厂商的训练环境供给;多语言编码能力评估(本报告体系有 专题调查)。
Terminal-Bench
Stanford / Laude Institute · 2026-01 · arXiv:2601.11868
测:真实终端困难任务
CLI
真实命令行环境
副作用
文件污染 / 权限提升成为考察点
测试目的:把评测从「改代码」扩展到「在终端里完成真实运维/构建/调试任务」,命令执行的副作用要求沙盒具备不可变文件系统与最小权限网络。
场景:DevOps 类 Agent、CLI 助手能力验收。
ArtifactsBench
腾讯混元 · 2025-07 · arXiv:2507.04952
测:代码产物的视觉-交互质量
视觉+交互
弥合「能跑」与「好用好看」的落差
测试目的:传统代码基准只测功能对错;ArtifactsBench 评前端/可视化产物的渲染正确性与交互可用性,对应「AI 生成网页/应用」的真实质量标准。
场景:vibe-coding 产品(生成式建站/App)的质量验收。
SLIDE 04 / 13 领域 B · SERVING

B · 推理服务与硬件能效:把「每瓦电力」变成竞争力单位Serving & Hardware Efficiency Benchmarks

测什么:不是模型聪不聪明,而是推理系统在真实 Agent 负载(数百轮、超长上下文、工具调用穿插)下的服务能力——固定服务水平(SLO)下的最大并发、每兆瓦电力能养活的 Agent 数、延迟-吞吐的 Pareto 前沿。测试目的:为数据中心采购、推理云容量规划、硬件选型提供可比口径。注意:这两个是当前仅有的「面向 Agent 负载」的硬件/服务级基准,都还在征集期,结果覆盖有限。

AA-AgentPerf
Artificial Analysis · 2026-06-12 · 开放提交中
测:Agents per Megawatt硬件栈 × 推理栈
61,354
GB300 NVL72 每兆瓦并发 Agent 数(SLO Tier 1)
~23.7×
vs HGX H200(2,594)
20/60/180
三级 SLO 的 P25 tok/s 门槛
测试目的:在固定服务水平下搜索「不跌破 SLO 的最大并发 Agent 数」,除以实测加速器功耗——回答「同样 1MW 电力,投资能多产出多少倍」。轨迹来自真实编码 Agent(200 轮、>100K token 上下文)。
场景:数据中心电力预算下的硬件采购、GPU 厂商全栈竞赛(本报告体系有 专题调查)。
MLPerf Agentic Inference
MLCommons · 2026-07 发布 · 征集期(尚无公开提交结果)
测:轨迹级 SLO + 准确性门禁
613 条
真实 Agent 轨迹(113 编码+500 工作流)
30,335
总轮数;262,144 token 上下文
3 级
准确性门禁(OSL/Inline/Standalone)
测试目的:MLPerf 体系向 Agent 负载的扩展:用真实多轮轨迹重放替代合成请求,以「准确性门禁+Pareto 前沿」防止「堆并发刷吞吐」;明确允许 KV Cache 复用、推测解码等生产优化。
场景:推理框架与服务部署的行业对标;边缘端子集测量化部署(本报告体系有 专题调查)。
边界提示B 类基准测「系统」不测「模型」;A/C 类基准测「模型+脚手架」不测硬件。当前没有任何公开基准同时提供「同一模型 × 不同硬件」与「同一硬件 × 不同模型」的完整对照——采购决策需要组合使用 A+B 两类证据。
SLIDE 05 / 13 领域 C · LEARNING

C · 长时程学习与自我进化:把「学习速率」变成可测量量Long-Horizon Learning Benchmarks

测什么:Agent 在真实环境中连续工作 12–72 小时、利用反馈持续改进的速率——不是「已经会什么」,而是「能学会什么」。测试目的:追踪模型代际间「环境学习效率」的演进,并检验长会话基础设施(断点续跑、状态持久化、服务稳定性)。现状:该领域目前只有 EdgeBench 一家,2026 年 7 月刚发布,尚无独立复现。

EdgeBench
字节跳动 Seed · 2026-07-02 · arXiv:2607.05155
测:Score@t 学习曲线学术探索期
134 任务
6 大能力族;51 公开 / 83 保留防污染
38,000 小时
累计 Agent-环境交互
R²=0.998
log-sigmoid 缩放律拟合精度
~3 个月
前沿模型学习速度翻倍周期
测试目的:以 Score@2h…12h 曲线与 log-sigmoid 三参数(Smax/tmid/β)度量环境学习效率;配套开源 SForge 评测框架(双容器隔离、stop-hook/auto-resume/auto-eval)。
场景:模型代际研究、长时程 Agent 产品的能力上限评估(本报告体系有 专题调查)。
为什么单独成类EdgeBench 的消融证明「经验连续性」在同预算下值 +6.9 分、「1M vs 200k 上下文」值 4.4–5.8 分——这类基准测量的其实是「模型 × 脚手架 × 服务」的组合,与 A 类「单点通过率」是不同物种。复现成本(38,000 小时交互)未披露,结论强度应保留。
SLIDE 06 / 13 领域 D · TOOL USE

D · 工具与函数调用:Agent 的「手」好不好用Tool & Function Calling Benchmarks

测什么:从单次「选对 API、填对参数」(BFCL、ToolLLM)到多轮「工具-Agent-用户」三方交互与双控环境(τ 系列)。测试目的:函数调用是 Agent 连接现实世界的接口层,这类分数直接预测客服、订票、办公自动化等产品的可靠性。特点:判分可程序化(AST 比对/状态检查),是自动化程度最高的一类基准。

BFCL(Berkeley Function Calling Leaderboard)
UC Berkeley · ICML 2025 · V4 榜单持续更新
测:函数调用正确性持续更新
V4
从工具用到 Agentic 评测持续演进
测试目的:标准化评估模型的 API 选择、参数生成、并行/嵌套调用与多轮调用能力;可执行验证保证判分客观。
场景:函数调用模型选型的首选公开榜;API 编排产品的回归测试。
τ-bench / τ²-bench
Sierra · 2024 / 2025-06 · arXiv:2406.12045 / 2506.07982
测:工具-用户协同完成任务
双控环境
τ²:用户也可操作环境状态
66.1%
Kimi K2 技术报告引用 τ²-Bench 成绩
测试目的:模拟真实客服域(航空/零售/电信):Agent 需与用户模拟器对话、调用领域 API、遵守政策完成状态变更;τ² 升级为「用户与 Agent 都可改变环境」的双控设定,更贴近真实协作。
场景:客服/售后 Agent 上线前验收;模型发版常被引用(Kimi K2 等)。
ToolLLM / ToolBench
清华等 · ICLR 2024 · arXiv:2307.16789
测:大规模真实 API 掌握
16,000+
真实世界 API
测试目的:检验模型在海量真实 API 中的检索-选择-调用链路,是「工具学习」方向的基础基准。
场景:工具检索与路由研究;通用工具调用训练数据评估。
SLIDE 07 / 13 领域 E · COMPUTER USE

E · 计算机操作(GUI / Web):像素与真实操作系统里的考试Computer-Use & Web Benchmarks

测什么:Agent 在完整虚拟机或真实 Web 环境中完成开放式任务——看屏幕、点鼠标、敲键盘、跨应用操作,用环境状态(而非字符串匹配)判定成败。测试目的:Computer-Use 是 2025–2026 年模型厂商的发版重点(Claude Computer Use、OpenAI Operator 类),这类基准是唯一的公开对照口径。特点:评测必须跑真实 VM,成本与工程门槛远高于文本基准。

OSWorld / OSWorld-Verified
xLang Lab 等 · NeurIPS 2024 / Verified 2025-07 · arXiv:2404.07972
测:真实 OS 开放式任务VM 级评测
369
真实计算机任务
<1 小时
Verified 版 AWS 并行全量评测时长
测试目的:在 VMware/VirtualBox/AWS/Azure/Docker 后端的完整 OS 中执行任务,以系统状态判分;Verified 版修复判分缺陷并大幅压测(修复前 BenchJack 审计可 100% 破解,修复信任边界后降至 0%)。
场景:Computer-Use Agent 发版必测;桌面自动化产品选型。
Windows Agent Arena
Microsoft · 2024 · arXiv:2409.08264
测:Windows 规模化 OS Agent
150+
Windows 任务;Azure VM 并行
测试目的:OSWorld 的 Windows 侧对应物,要求 UI Automation 桥接与 Azure 虚拟机集成,验证 Windows 生态下的可操作性。
场景:Windows 桌面 Agent、企业 RPA 升级评估。
WebArena / VisualWebArena
CMU · ICLR 2024 / ACL 2024 · arXiv:2307.13854 / 2401.13649
测:真实 Web 环境自主任务
自托管站点
电商/论坛/GitLab 等真实功能副本
测试目的:在功能完整的自托管 Web 应用中完成任务(购物、发帖、建 issue),以结果状态判分;VWA 增加视觉理解要求。
场景:Web 浏览 Agent 研究基准;注意 BenchJack 审计发现其修复前可被破解,引用分数需注明版本。
SLIDE 08 / 13 领域 F · MEMORY

F · 记忆与长上下文:跨会话「记得住、会更新、懂拒答」Memory & Long-Context Benchmarks

测什么:聊天助手与 Agent 在超长对话中的长期记忆能力——信息提取、多会话推理、知识更新、时效性与拒答(承认「不记得」而非编造)。测试目的:验证「记忆」是否应从上下文窗口外迁为独立服务;BEAM 与 LongMemEval 的结论是:纯上下文路线在 1.5M–10M token 规模下均不可持续。

LongMemEval
ICLR 2025 · arXiv:2410.10813
测:聊天助手长期交互记忆
~1.5M token
累计对话规模
5 类
提取/更新/推理/时效/拒答
测试目的:系统拆解长期记忆为五种可单独考核的能力,其中「知识更新」与「拒答」是现有模型失分重灾区——为记忆系统设计提供精确的需求规格。
场景:个人助理/陪伴型产品的记忆功能验收。
BEAM / LIGHT
2025-10 · arXiv:2510.27246
测:百万级 token 长期记忆
10M token
最长会话规模
失效
1M 上下文模型+RAG 仍随对话变长退化
测试目的:把会话规模推到 10M token,实验证明「纯上下文」与「上下文+RAG」两条路线在超长规模均失效;作者提出 LIGHT 三记忆系统作为解法方向。
场景:记忆即服务(Memory-as-a-Service)架构论证的核心证据。
LoCoMo / MemoryBank
ACL 2024 / AAAI 2024 · arXiv:2402.17753 / 2305.10250
测:超长期对话记忆(早期)
测试目的:更早一代的长期记忆基准:LoCoMo 评估跨多会话的对话记忆,MemoryBank 验证带遗忘曲线的记忆注入机制。规模与区分度已被 LongMemEval/BEAM 超越。
场景:文献溯源与方法基线;新项目建议直接用 LongMemEval。
SLIDE 09 / 13 领域 G · SECURITY

G · 安全与对抗:上线前的「门禁」类测试Security & Adversarial Benchmarks

测什么:四类风险——① 提示注入(AgentDojo);② 有害任务执行意愿(AgentHarm/HarmBench/CyberSecEval);③ 工具供应链投毒(MCPTox);④ 基准本身可不可信(BenchJack 审计「不解题刷分」)。测试目的:能力基准回答「能做什么」,安全基准回答「会不会被利用做什么」——后者是生产上线的前置条件。

AgentDojo
ETH SPY Lab · NeurIPS 2024 D&B
测:提示注入攻防
69%→50%
GPT-4o 攻击下效用下跌
动态
攻防可持续扩展的环境
测试目的:在真实工具组合(邮件/日历/银行/旅行)中注入恶意指令,同时度量「效用保持」与「攻击成功率」,推动防御方案可比。
场景:一切接入不可信内容(网页/邮件/文档)的 Agent 上线前必测。
AgentHarm / HarmBench / CyberSecEval 3
ICLR 2025 / ICML 2024 / Meta Purple Llama 2024 · arXiv:2410.09024 / 2402.04249 / 2408.01605
测:有害性与网络安全滥用
测试目的:AgentHarm 测模型执行多步有害任务(欺诈/网络犯罪等)的意愿;HarmBench 提供自动化红队与拒答鲁棒性框架;CyberSecEval 3 扩展到有传染性的 Agentic 网络攻击评估。
场景:模型发布安全审查、监管合规材料(EU AI Act 类)证据。
MCPTox
AAAI 2026 · arXiv:2508.14925
测:MCP 工具投毒攻击
真实 MCP
面向真实 MCP Server 的工具投毒
测试目的:MCP 成为工具接入标准后,恶意/被篡改的 MCP Server 可向 Agent 投毒(隐藏指令、数据外泄);MCPTox 是首个针对该攻击面的基准。
场景:MCP 生态接入方的供应链安全审计。
BenchJack
UC Berkeley · 2026-05 · arXiv:2605.12673
测:基准可破解性(元安全)
9 / 10
主流基准可「不解题刷到接近满分」
≈100%→<10%
经 3 轮迭代修复后的可破解率
测试目的:自动攻击基准的评分通道(评分器探测、信任边界穿越、环境操纵),回答「这个分数还能不能信」;OSWorld/WebArena 修复前可 100% 破解。
场景:引用任何 Agent 基准分数前的可信度审计;新基准设计的验收工具。
SLIDE 10 / 13 领域 H · MULTI-AGENT

H · 多智能体协作:失败模式与多任务干扰Multi-Agent System Benchmarks

测什么:多 Agent 系统特有的失败——角色混乱、信息丢失、验证缺失(MAST 归纳的 14 种失败模式),以及多任务并行时的相互干扰(C³-Bench)。测试目的:多智能体框架(AutoGen/MetaGPT/ChatDev 等)的工程设计依据与回归测试。

MAST(Why Do Multi-Agent LLM Systems Fail?)
UC Berkeley · 2025-03 · arXiv:2503.13657
测:多智能体失败模式分类
14 种
失败模式(3 大类)
测试目的:不是排行榜而是「诊断学」——对多智能体执行轨迹做失败归因分类(系统设计/协作通信/验证终止),让「为什么失败」可统计、可改进。
场景:多智能体系统复盘与框架选型;轨迹标注训练。
C³-Bench
腾讯 · 2025-05 · arXiv:2505.18746(会议信息未能独立核实)
测:多任务并行干扰
测试目的:考察真实场景中最扰动 Agent 的因素:多任务并发、任务间依赖与资源冲突下的规划与恢复能力。
场景:编排器/调度器设计验证;腾讯体系内用于混元 Agent 迭代。
SLIDE 11 / 13 领域 I · DOMAIN

I · 垂直行业与职业:落地前的「行业验收」Domain & Professional Benchmarks

测什么:通用基准高分不等于行业可用。这一类由行业方或大厂自建,复刻真实岗位工作流:金融分析师的数据抓取与推理(FinSearchComp)、研究报告的引用忠实度(ReportBench)、电商全链路(EcomBench)、语音外呼的拟真对话(VoiceAgentEval)、深度检索(BrowseComp)。测试目的:行业 POC 的验收标准与「职业对齐」刻度尺。

FinSearchComp
字节跳动 Seed 等 · 2025-09 · arXiv:2509.13160
测:金融搜索与推理
635 题
70 位金融专家标注
21 模型
横评:Grok 4 领跑全球子集、豆包领跑大中华子集
测试目的:复刻分析师「时效数据抓取—历史查询—复杂调查」工作流;验证「网页搜索+金融插件」对成绩的提升,为金融数据网关提供验收标准。
场景:金融 AI 产品(行情问答/研报助手)的能力验收。
ReportBench
ByteDance BandAI · 2025-08 · arXiv:2508.15804
测:深度研究报告质量
100 任务
arXiv 综述反向工程;平均 153 篇参考文献 ground truth
测试目的:用 agentic 流水线逐句验证引用忠实度与非引用陈述的事实性——针对 Deep Research 类产品的「看起来专业但引用瞎编」问题。
场景:Deep Research / 研报生成产品的质量验收。
EcomBench
阿里通义实验室(Tongyi Lab)· 2025-12 · arXiv:2512.08868
测:电商全链路 Agent
测试目的:面向电商场景的基础 Agent 全面评估(商品理解、客服、运营决策等),由行业头部玩家定义「能上岗」的规格。
场景:电商 Agent 产品验收;注意归属为阿里通义,非京东(主报告已勘误)。
VoiceAgentEval(正文名 OutboundEval)
声网 × 美团 × xbench · 2025-10/2026-02 · arXiv:2510.21244
测:语音外呼智能体
30 子场景
6 大业务领域
150 人设
用户模拟器(美团贡献)
15 指标
语音维度评分
测试目的:把文本 Agent 评测扩展到语音通道:打断处理、口音鲁棒、业务闭环,用大规模人设模拟器制造真实对话分布。
场景:外呼/客服语音 Agent 上线验收(xbench 职业对齐系列成员)。
BrowseComp / xbench 系列 / GAIA
OpenAI 2025(arXiv:2504.12516)· 红杉中国 xbench · GAIA(通用助理)
测:深度检索 / 职业对齐 / 通用助理
75.15%
京东 JoyAgent-JDGenie 的 GAIA 验证集成绩
测试目的:BrowseComp 测「难找但可验证」的信息检索;xbench(红杉中国)按职业真实任务对齐评估;GAIA 测通用助理的多跳任务,常被开源 Agent 项目用作发版对照。
场景:Deep Research 产品对比;投资与咨询机构的职业对齐参照;开源 Agent 营销口径。
SLIDE 12 / 13 领域 J · EVAL INFRA

J · 评测基础设施与元评测:测「评测本身」Evaluation Infrastructure & Meta-Evaluation

测什么:当分数成为生产资料,评测过程本身也需要被测量——成本可不可归因(HAL)、过程质量可不可诊断(AgentProcessBench)、奖励模型可不可信(CUARewardBench)、评测资产可不可复用(Inspect/inspect_evals)。测试目的:没有这一层,其他九类的分数都无法审计。

HAL(Holistic Agent Leaderboard)
Princeton 等 · 2025-10 · arXiv:2510.11977
测:三维(模型×脚手架×成本)整体评估
21,730 次
rollout;9 模型 × 9 基准
≈$40,000
总成本(罕见的成本透明案例)
2.5B token
公开 Agent 日志
测试目的:证明「同一模型换脚手架可差 20–30 分」,把成本与配置作为一等公民纳入榜单;轨迹数据本身成为新生产资料。
场景:严肃对比研究的脚手架;成本归因方法论范本。
Inspect / inspect_evals
UK AI Security Institute · 2024 / 2025 · arXiv:2507.06893
测:开源评测框架与资产库
70+
社区维护的评测实现
测试目的:政府安全机构主导的开源评测栈:统一评测定义、沙箱执行与评分器复用,降低「各跑各的」导致的口径漂移。
场景:监管与第三方审计机构;企业内评测平台建设底座。
AgentProcessBench / CUARewardBench
2026-03 / 腾讯优图 2025-10 · arXiv:2603.14465 / 2510.18596
测:过程质量与奖励模型
1,000 / 8,509
AgentProcessBench 轨迹数 / 步级标注数(一致性 89.1%)
测试目的:结果对≠过程对。AgentProcessBench 做步级过程诊断(工具使用是否每一步合理);CUARewardBench 评估「计算机操作 Agent 的奖励模型」本身打得准不准——过程监督的训练数据地基。
场景:过程奖励模型(PRM)训练、Agent 调试与归因工具开发。
SLIDE 13 / 13 场景 × 选型

哪些场景在用:六类使用方的选型地图Who Uses What, For What

同一个测试套,在不同使用方手里是不同工具:模型厂商用来发版营销,硬件厂商用来争取订单,企业用来选型验收,安全团队用来设置门禁,研究团队用来生产知识,监管机构用来建立审计口径。

使用方 / 目的A 编码B 服务能效C 长时程学习D 工具调用E 计算机操作F 记忆G 安全H 多智能体I 垂直行业J 评测基建
模型厂商(发版与营销)●○●●●○●○●○
硬件/云厂商(争取采购)○●○○○○○○○○
企业技术选型(POC 验收)●●○●●●●●●○
安全/合规团队(上线门禁)○○○○○○●○○●
训练与环境供给(RL/数据)●○●○○○○○○●
监管/第三方审计○○○○○○●○○●

● 核心使用场景 ○ 偶发引用。依据:各基准官方定位与本报告体系调查(SWE-bench Verified 弃用公告、AA-AgentPerf/MLPerf 官方文章、HAL 成本披露、UK AISI 框架定位等)。

附录 APPENDIX

总结:选型的四条军规Four Rules for Choosing Benchmarks

军规一
先定被测对象,再选基准。测模型能力用 A/C/D/E/F,测推理系统与硬件用 B,测可信度用 G/J——对象错了,分数无效。
军规二
先查基准状态,再引用分数。SWE-bench Verified 已被官方弃用;BenchJack 证明 9/10 基准可被刷分——引用前确认版本、修复状态与污染状况。
军规三
同分必须同配置。HAL 证明换脚手架可差 20–30 分;AA-AgentPerf 证明厂商自提交配置与第三方配置不可直接比较。比分数先比配置。
军规四
要求成本与口径披露。无成本数字的榜单无法折算 ROI(EdgeBench 38,000 小时成本未披露);无 SLO 的吞吐数字是营销(AA-AgentPerf 的教训)。

深入阅读(本报告体系专题调查):SWE-bench 家族 · SWE-Universe · EdgeBench · AA-AgentPerf · MLPerf Agentic · 基础设施瓶颈诊断 · 主报告

参考来源(均经本报告体系核实,arXiv 编号可查)