本图鉴汇总 2023–2026 年学术界与工业界有影响力的 AI Agent 测试套,按「测试目标 × 领域」分为十大类,逐一回答四个问题:测什么、有哪些测试套、哪些场景在用、测试目的是什么。全部条目均来自本报告体系已核实的论文与官方资料(arXiv 编号可查),含已被官方弃用或证伪的基准并如实标注——选型时必须知道哪些分数还能信。
「AI Agent 基准」不是一类东西。有的测模型能力(能不能做对),有的测系统性能(单位资源能服务多少),有的测可信度(能不能防攻击、防作弊、防污染),还有的测评测本身(分数还可不可信)。下表是全图鉴的索引,后续每页展开一个领域。
| 领域 | 测试目标(测什么) | 代表测试套(机构 · 年份) | 典型使用场景 |
|---|---|---|---|
| A 编码与软件工程 | 真实 issue 修复、终端操作、代码产物质量 | SWE-bench 家族(Princeton/OpenAI/Scale AI)、SWE-Universe(阿里 Qwen 2026)、Terminal-Bench(Stanford 2026)、ArtifactsBench(腾讯 2025) | 模型发版主战场、编码助手选型、训练环境工厂 |
| B 推理服务与硬件能效 | 固定服务水平下的容量、每兆瓦 Agent 数 | AA-AgentPerf(Artificial Analysis 2026)、MLPerf Agentic Inference(MLCommons 2026) | 数据中心采购、推理云容量规划、硬件厂商竞赛 |
| C 长时程学习与自我进化 | 环境交互中的学习速率(12–72 小时) | EdgeBench(字节 Seed 2026,arXiv:2607.05155) | 模型代际追踪、学习动力学研究、长会话基建验收 |
| D 工具与函数调用 | API 选择、参数生成、多轮工具-用户交互 | BFCL(UC Berkeley,V4 持续更新)、τ-bench / τ²-bench(Sierra 2024/2025)、ToolLLM(2023) | 函数调用模型选型、客服/订票类 Agent 验收 |
| E 计算机操作(GUI/Web) | 真实操作系统与浏览器中的开放式任务 | OSWorld / OSWorld-Verified(xLang 2024/2025)、Windows Agent Arena(Microsoft 2024)、WebArena / VisualWebArena(CMU 2023/2024) | 桌面自动化、RPA、Computer-Use Agent 发版必测 |
| F 记忆与长上下文 | 跨会话长期记忆的保持、更新与拒答 | LongMemEval(ICLR 2025,1.5M token)、BEAM/LIGHT(2025,10M token)、LoCoMo(ACL 2024)、MemoryBank(AAAI 2024) | 记忆服务/个人助理产品的能力验收 |
| G 安全与对抗 | 注入攻击、有害行为、MCP 投毒、基准可破解性 | AgentDojo(ETH 2024)、AgentHarm(ICLR 2025)、HarmBench(ICML 2024)、CyberSecEval 3(Meta 2024)、MCPTox(AAAI 2026)、BenchJack(UC Berkeley 2026) | 上线前安全门禁、红队演练、基准可信度审计 |
| H 多智能体协作 | 协作失败模式、多任务干扰 | MAST(UC Berkeley 2025,14 种失败模式)、C³-Bench(腾讯 2025) | 多智能体框架设计与回归测试 |
| I 垂直行业与职业 | 金融/电商/语音外呼/研究报告的行业级交付质量 | FinSearchComp(字节 2025)、ReportBench(字节 2025)、EcomBench(阿里通义 2025)、VoiceAgentEval(声网×美团×xbench 2025)、BrowseComp(OpenAI 2025)、xbench(红杉中国) | 行业落地 POC 验收、职业技能对齐 |
| J 评测基础设施与元评测 | 评测的成本、过程质量、可复现性 | HAL(Princeton 2025)、Inspect / inspect_evals(UK AISI 2024/2025)、AgentProcessBench(2026)、CUARewardBench(腾讯优图 2025) | 评测平台建设、过程监督、奖励模型训练 |
测什么:Agent 能否在真实代码库中定位问题、修改代码并通过隐藏测试——从单 issue 修复(SWE-bench)、终端操作(Terminal-Bench)到前端产物质量(ArtifactsBench)。这一领域同时包含「测能力」的榜单与「供给环境」的工厂(SWE-Universe)。测试目的:编码是 Agent 最先商业化的场景,分数直接决定模型发版叙事与 IDE 产品选型。警示:该领域也是污染与过拟合的重灾区——SWE-bench Verified 已被官方弃用,引用任何分数前请先核对基准状态。
测什么:不是模型聪不聪明,而是推理系统在真实 Agent 负载(数百轮、超长上下文、工具调用穿插)下的服务能力——固定服务水平(SLO)下的最大并发、每兆瓦电力能养活的 Agent 数、延迟-吞吐的 Pareto 前沿。测试目的:为数据中心采购、推理云容量规划、硬件选型提供可比口径。注意:这两个是当前仅有的「面向 Agent 负载」的硬件/服务级基准,都还在征集期,结果覆盖有限。
测什么:Agent 在真实环境中连续工作 12–72 小时、利用反馈持续改进的速率——不是「已经会什么」,而是「能学会什么」。测试目的:追踪模型代际间「环境学习效率」的演进,并检验长会话基础设施(断点续跑、状态持久化、服务稳定性)。现状:该领域目前只有 EdgeBench 一家,2026 年 7 月刚发布,尚无独立复现。
测什么:从单次「选对 API、填对参数」(BFCL、ToolLLM)到多轮「工具-Agent-用户」三方交互与双控环境(τ 系列)。测试目的:函数调用是 Agent 连接现实世界的接口层,这类分数直接预测客服、订票、办公自动化等产品的可靠性。特点:判分可程序化(AST 比对/状态检查),是自动化程度最高的一类基准。
测什么:Agent 在完整虚拟机或真实 Web 环境中完成开放式任务——看屏幕、点鼠标、敲键盘、跨应用操作,用环境状态(而非字符串匹配)判定成败。测试目的:Computer-Use 是 2025–2026 年模型厂商的发版重点(Claude Computer Use、OpenAI Operator 类),这类基准是唯一的公开对照口径。特点:评测必须跑真实 VM,成本与工程门槛远高于文本基准。
测什么:聊天助手与 Agent 在超长对话中的长期记忆能力——信息提取、多会话推理、知识更新、时效性与拒答(承认「不记得」而非编造)。测试目的:验证「记忆」是否应从上下文窗口外迁为独立服务;BEAM 与 LongMemEval 的结论是:纯上下文路线在 1.5M–10M token 规模下均不可持续。
测什么:四类风险——① 提示注入(AgentDojo);② 有害任务执行意愿(AgentHarm/HarmBench/CyberSecEval);③ 工具供应链投毒(MCPTox);④ 基准本身可不可信(BenchJack 审计「不解题刷分」)。测试目的:能力基准回答「能做什么」,安全基准回答「会不会被利用做什么」——后者是生产上线的前置条件。
测什么:多 Agent 系统特有的失败——角色混乱、信息丢失、验证缺失(MAST 归纳的 14 种失败模式),以及多任务并行时的相互干扰(C³-Bench)。测试目的:多智能体框架(AutoGen/MetaGPT/ChatDev 等)的工程设计依据与回归测试。
测什么:通用基准高分不等于行业可用。这一类由行业方或大厂自建,复刻真实岗位工作流:金融分析师的数据抓取与推理(FinSearchComp)、研究报告的引用忠实度(ReportBench)、电商全链路(EcomBench)、语音外呼的拟真对话(VoiceAgentEval)、深度检索(BrowseComp)。测试目的:行业 POC 的验收标准与「职业对齐」刻度尺。
测什么:当分数成为生产资料,评测过程本身也需要被测量——成本可不可归因(HAL)、过程质量可不可诊断(AgentProcessBench)、奖励模型可不可信(CUARewardBench)、评测资产可不可复用(Inspect/inspect_evals)。测试目的:没有这一层,其他九类的分数都无法审计。
同一个测试套,在不同使用方手里是不同工具:模型厂商用来发版营销,硬件厂商用来争取订单,企业用来选型验收,安全团队用来设置门禁,研究团队用来生产知识,监管机构用来建立审计口径。
| 使用方 / 目的 | A 编码 | B 服务能效 | C 长时程学习 | D 工具调用 | E 计算机操作 | F 记忆 | G 安全 | H 多智能体 | I 垂直行业 | J 评测基建 |
|---|---|---|---|---|---|---|---|---|---|---|
| 模型厂商(发版与营销) | ● | ○ | ● | ● | ● | ○ | ● | ○ | ● | ○ |
| 硬件/云厂商(争取采购) | ○ | ● | ○ | ○ | ○ | ○ | ○ | ○ | ○ | ○ |
| 企业技术选型(POC 验收) | ● | ● | ○ | ● | ● | ● | ● | ● | ● | ○ |
| 安全/合规团队(上线门禁) | ○ | ○ | ○ | ○ | ○ | ○ | ● | ○ | ○ | ● |
| 训练与环境供给(RL/数据) | ● | ○ | ● | ○ | ○ | ○ | ○ | ○ | ○ | ● |
| 监管/第三方审计 | ○ | ○ | ○ | ○ | ○ | ○ | ● | ○ | ○ | ● |
● 核心使用场景 ○ 偶发引用。依据:各基准官方定位与本报告体系调查(SWE-bench Verified 弃用公告、AA-AgentPerf/MLPerf 官方文章、HAL 成本披露、UK AISI 框架定位等)。
深入阅读(本报告体系专题调查):SWE-bench 家族 · SWE-Universe · EdgeBench · AA-AgentPerf · MLPerf Agentic · 基础设施瓶颈诊断 · 主报告