一、诊断方法:如何把「模型考卷」读成「Infra 体检报告」Methodology
绝大多数 Agent 基准的目的是度量模型能力,但其实验设计和附带披露的运行数据同样包含基础设施信息。本诊断对每项基准按三步拆解:第一步,看评分依赖什么基础设施(容器、VM、浏览器、RTC 引擎、数据库),评分被哪些 Infra 因素污染;第二步,提取论文/官方披露的基础设施实测数据(吞吐、成本、成功率、延迟、可破解率),逐项标注为 实测;第三步,基于实测证据指出瓶颈,并给出可验证的机会点方向(标注为 推导,属本诊断的工程分析而非论文结论)。
二、执行环境层:规模化、复现性与验证器质量Execution Environment
SWE-bench 系列(含 Verified / Pro)
容器沙盒证据强度:高(论文+官方审计)基准对 Infra 的实测情况
实测评分完全依赖在 Docker 容器内执行仓库测试套件(FAIL_TO_PASS+PASS_TO_PASS);2024 年 6 月在 OpenAI 支持下全面容器化,官方承认此前「开发环境难以可靠搭建」导致正确答案被误判[1][2]。
实测OpenAI 2026 年 2 月审计 138 道最难题:82 道(59.4%)测试有缺陷,会拒绝功能正确的补丁;500 题金补丁全部可被前沿模型逐字复述(训练污染),SWE-bench Verified 因此被弃用[4]。
实测SWE-bench Pro 采用 Public 731 / Held-out 858 / Commercial 276 的三分法抗污染,前沿模型仅约 23%–25%,保留区分度[3]。
SWE-Universe(阿里 Qwen × 浙大)
环境工厂证据强度:高(论文披露完整 Infra 栈)基准对 Infra 的实测情况
实测从 GitHub 近五年约 3,330 万个 PR 筛选约 100 万候选,用 MoE 构建模型(Qwen-Next-80A3,构建成功率 78.44%,超过 Claude-Opus-4.5 的 77.81%)自动合成 Docker 环境+验证脚本,最终产出 807,693 个可验证环境(52,960 仓库、8 类语言)[5]。
实测Infra 栈:每个构建任务分发到独立阿里云 ECS 沙盒 VM;镜像推送 ACR 并以 Docker 层缓存复用公共基础层压缩存储成本;MegaFlow 分布式长任务编排;环内 hacking 检测器拒绝 grep 式假验证器;迭代自检将构建成功率从 82.6% 提升至 94%[5]。
实测下游闭环:5 种脚手架生产 50 万条成功轨迹(300 亿 token)→ 拒绝采样 → 异步 RL(2–4 倍提速)→ SWE-bench Verified 75.3%[5]。
OSWorld / OSWorld-Verified
桌面 VM证据强度:高(论文+官方更新日志)三、推理与计算层:长上下文成本与「窗口不可持续」证据Inference & Compute
BEAM(10M token 长记忆基准)
推理引擎证据强度:中高(论文有对比实验,无系统指标)基准对 Infra 的实测情况
实测100 段最长 10M token 的连贯会话+2,000 个验证问题:即便 1M 上下文窗口的模型(无论是否叠加 RAG),性能都随对话变长持续退化;外挂三系统记忆(LIGHT:情景/工作/草稿本)相对最强基线平均提升 3.5%–12.69%[8]。
VoiceAgentEval(声网 × 美团 × xbench)
语音流水线证据强度:中(发布资料含指标体系,少系统数据)基准对 Infra 的实测情况
实测把语音维度 15 项指标(ASR 准确率、响应延迟、打断成功率、音质、交互体验)纳入正式计分,评测直接跑在声网对话式 AI 引擎的真实 RTC 平台上采集;美团基于真实外呼数据泛化出 150 组人设的用户模拟器,并用三种方法校验模拟器与真实对话的逼近度[9]。
四、工具与网关层:状态一致性与供应链信任Tool Gateway
τ-bench / τ²-bench(Sierra)
状态化工具调用证据强度:中高(协议设计含 Infra 语义)BFCL v4(UC Berkeley)
函数调用证据强度:高(成本/延迟正式入榜)五、记忆与存储层:知识更新与拒答暴露的「数据库能力」缺口Memory & Storage
六、安全与可信层:评测基建本身成为攻击面Security & Trust
BenchJack(UC Berkeley,2026-05)
评测信任边界证据强度:高(系统化红队审计)AgentDojo / MCPTox
注入与供应链证据强度:高(联合计分体系)七、评测平台层:成本、可比性与长时程Evaluation Platform
HAL(Holistic Agent Leaderboard,Princeton 等)
评测基础设施证据强度:高(以 Infra 为研究对象)EdgeBench(字节 Seed,2026-07)
长时程运行证据强度:高(38,000 小时实测)基准对 Infra 的实测情况
实测134 个真实任务,单任务 12–72 小时连续运行,累计分析约 38,000 小时 Agent 交互;发现环境学习性能服从 log-sigmoid 缩放律(R²=0.998),Agent 学习速度约每 3 个月翻一番;人类专家基线平均完成时长 57.2 小时;51 任务公开、83 保留防污染[22]。
八、瓶颈全景与机会点汇总Bottleneck Map & Opportunities
| Infra 层 | 已被实测证实的瓶颈 | 证据(基准) | 机会点 | 可验证指标 |
|---|---|---|---|---|
| 执行环境 | 环境漂移致误判;59.4% 最难题测试有缺陷;验证器可伪造 | SWE-bench 审计[4]、SWE-Universe[5] | 验证器可信工程+环境工厂 | 构建成功率 ≥94%、双态自检覆盖 100% |
| 执行环境 | 桌面评测吞吐以天计;信任边界可 100% 绕过 | OSWorld-Verified[7]、BenchJack[12] | 快照经济学+红队 CI | 全量评测 <1h;可破解率 <10% |
| 推理计算 | 1M 窗口+RAG 在 10M 会话下失效;长会话成本不可控 | BEAM[8] | KV 三级存储+前缀缓存运营 | 前缀命中率、长会话单位成本 |
| 语音流水线 | 延迟/打断首次被正式计分;用户模拟集群缺失 | VoiceAgentEval[9] | 语音 SLO 监控+模拟器服务化 | 端到端往返、打断响应 P99 |
| 工具网关 | 双控下性能显著下降;pass^k 抖分;成本无归集 | τ²-bench[11]、BFCL[14] | 有状态网关+成本归因 | pass^k 门禁、每调用成本记录率 |
| 记忆存储 | 知识更新与拒答系统性失分;RAG 收益递减 | LongMemEval[16]、LoCoMo[17] | 记忆即服务(版本链+置信度) | KU 子项正确率、拒答准确率 |
| 安全可信 | 9/10 基准可刷分;注入下效用 69%→50%;MCP 可投毒 | BenchJack[12]、AgentDojo[18]、MCPTox[19] | 零信任基线+消毒管道+签名验证 | ASR 增幅、BU 损失、审计覆盖率 |
| 评测平台 | 脚手架差 20–30 分;$40K 横评成本;异常行为潜伏 | HAL[20] | 标准化 harness+轨迹库+成本引擎 | 评测周期、每任务成本、轨迹覆盖率 |
| 长时程运行 | 12–72h 任务无持久化标准;学习速率无度量 | EdgeBench[22] | 持久化调度+断点续评 | checkpoint 恢复成功率、长任务完成率 |
机会点优先级(基于实测证据的紧迫度)
参考文献References
- [1] Jimenez, C. E., et al. SWE-bench: Can Language Models Resolve Real-World GitHub Issues? ICLR 2024. arXiv:2310.06770.
- [2] OpenAI & SWE-bench Team. Introducing SWE-bench Verified. 2024-08-13. openai.com.
- [3] Scale AI. SWE-bench Pro(1,865 题;Public 731 / Held-out 858 / Commercial 276). 2025. scale.com/leaderboard.
- [4] OpenAI. Why SWE-bench Verified No Longer Measures Frontier Coding Capabilities. 2026-02-23. openai.com.
- [5] Chen, M., et al.(Qwen Team, Alibaba & 浙江大学). SWE-Universe: Scale Real-World Verifiable Environments to Millions. arXiv:2602.02361, 2026-02.
- [6] Xie, T., et al. OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments. NeurIPS 2024. arXiv:2404.07972.
- [7] Xie, T., et al. Introducing OSWorld-Verified. xlang.ai, 2025-07-28.
- [8] Tavakoli, M., et al. Beyond a Million Tokens: Benchmarking and Enhancing Long-Term Memory in LLMs(BEAM/LIGHT). arXiv:2510.27246, 2025-10.
- [9] 声网 × 美团 × xbench. VoiceAgentEval:AI 外呼智能体评测基准. 2026-02;Xu, P., et al. arXiv:2510.21244.
- [10] Yao, S., et al.(Sierra). τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains. arXiv:2406.12045, 2024.
- [11] Barres, V., et al.(Sierra). τ²-Bench: Evaluating Conversational Agents in a Dual-Control Environment. arXiv:2506.07982, 2025-06.
- [12] Wang, H., et al.(UC Berkeley). Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack. arXiv:2605.12673, 2026-05.
- [13] Moonshot AI. Kimi K2: Open Agentic Intelligence(技术报告). 2025-07. github.com/MoonshotAI/Kimi-K2.
- [14] Patil, S. G., et al.(UC Berkeley). The Berkeley Function Calling Leaderboard (BFCL). ICML 2025;V4 榜单持续更新. gorilla.cs.berkeley.edu.
- [15] Qin, Y., et al. ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs. ICLR 2024. arXiv:2307.16789.
- [16] Wu, D., et al. LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory. ICLR 2025. arXiv:2410.10813.
- [17] Maharana, A., et al. Evaluating Very Long-Term Conversational Memory of LLM Agents(LoCoMo). ACL 2024. arXiv:2402.17753.
- [18] Debenedetti, E., et al.(ETH SPY Lab). AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents. NeurIPS 2024 D&B. arXiv:2406.13352.
- [19] Wang, Z., et al. MCPTox: A Benchmark for Tool Poisoning Attack on Real-World MCP Servers. AAAI 2026. arXiv:2508.14925.
- [20] Kapoor, S., et al.(Princeton 等). Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation. arXiv:2510.11977, 2025-10.
- [21] Anthropic. Demystifying Evals for AI Agents. Anthropic Engineering Blog, 2026-01.
- [22] Zhu, D., et al.(字节跳动 Seed 等). EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments. arXiv:2607.05155, 2026-07.