Infrastructure Diagnosis · 2026

AI Agent 基础设施瓶颈诊断
——基于 Benchmark 实测证据的瓶颈与机会点分析

本文不再以「模型能否解决问题」为视角,而是逐一拆解权威基准的实验设计与其对基础设施的实测情况,从中识别执行环境、推理计算、工具网关、记忆存储、安全可信、评测平台六个层面的真实瓶颈与机会点。所有数字均可溯源至论文或官方资料;基准未实测处明确标注「未见公开数据」,不推测、不夸大。

日期:2026 年 7 月 27 日 诊断对象:9 项权威基准 证据原则:实测数据 + 如实标注空白 与主报告互补使用

一、诊断方法:如何把「模型考卷」读成「Infra 体检报告」Methodology

绝大多数 Agent 基准的目的是度量模型能力,但其实验设计和附带披露的运行数据同样包含基础设施信息。本诊断对每项基准按三步拆解:第一步,看评分依赖什么基础设施(容器、VM、浏览器、RTC 引擎、数据库),评分被哪些 Infra 因素污染;第二步,提取论文/官方披露的基础设施实测数据(吞吐、成本、成功率、延迟、可破解率),逐项标注为 实测;第三步,基于实测证据指出瓶颈,并给出可验证的机会点方向(标注为 推导,属本诊断的工程分析而非论文结论)。

诚实声明:多数基准论文不披露沙盒冷启动延迟、KV 缓存命中率、网关 QPS 等系统级指标——这些空白本身就是「基础设施度量体系缺失」的证据,本文如实标注「未见公开数据」,并以 HAL、SWE-Universe、OSWorld-Verified 等少数披露了 Infra 数据的工作作为锚点。所有引用编号与主报告附录 C 的参考文献一致,可在 arXiv/官网逐一检索复核。

二、执行环境层:规模化、复现性与验证器质量Execution Environment

SWE-bench 系列(含 Verified / Pro)

容器沙盒证据强度:高(论文+官方审计)

基准对 Infra 的实测情况

实测评分完全依赖在 Docker 容器内执行仓库测试套件(FAIL_TO_PASS+PASS_TO_PASS);2024 年 6 月在 OpenAI 支持下全面容器化,官方承认此前「开发环境难以可靠搭建」导致正确答案被误判[1][2]。

实测OpenAI 2026 年 2 月审计 138 道最难题:82 道(59.4%)测试有缺陷,会拒绝功能正确的补丁;500 题金补丁全部可被前沿模型逐字复述(训练污染),SWE-bench Verified 因此被弃用[4]。

实测SWE-bench Pro 采用 Public 731 / Held-out 858 / Commercial 276 的三分法抗污染,前沿模型仅约 23%–25%,保留区分度[3]。

暴露的基础设施瓶颈

  • 环境漂移不可控:依赖冲突与版本差异曾使「正确答案被误判」成为系统性噪声——沙盒标准化是结果可信的前提[2]
  • 验证器质量无人负责:近六成最难题的测试本身有缺陷,且多年未被发现——测试缺陷审计不是模型问题,是基建缺位[4]
  • 污染无防线:公开题目进入训练语料后榜单失效,无保留集治理的基准寿命约 2 年[4]
机会点:推导建设「验证器可信工程」——双态自检(bug 态必败/修复态必过)、测试缺陷自动审计、保留集/私有集分级治理,是把代码评测从「参考分」升级为「工程决策依据」的必要投入。

SWE-Universe(阿里 Qwen × 浙大)

环境工厂证据强度:高(论文披露完整 Infra 栈)

基准对 Infra 的实测情况

实测从 GitHub 近五年约 3,330 万个 PR 筛选约 100 万候选,用 MoE 构建模型(Qwen-Next-80A3,构建成功率 78.44%,超过 Claude-Opus-4.5 的 77.81%)自动合成 Docker 环境+验证脚本,最终产出 807,693 个可验证环境(52,960 仓库、8 类语言)[5]。

实测Infra 栈:每个构建任务分发到独立阿里云 ECS 沙盒 VM;镜像推送 ACR 并以 Docker 层缓存复用公共基础层压缩存储成本;MegaFlow 分布式长任务编排;环内 hacking 检测器拒绝 grep 式假验证器;迭代自检将构建成功率从 82.6% 提升至 94%[5]。

实测下游闭环:5 种脚手架生产 50 万条成功轨迹(300 亿 token)→ 拒绝采样 → 异步 RL(2–4 倍提速)→ SWE-bench Verified 75.3%[5]。

暴露的基础设施瓶颈

  • 环境产能是硬约束:全行业环境规模三年从 2,294 涨到 807,693(约 350 倍),没有自动构建流水线的团队被锁死在千级[5]
  • 存储成本随规模爆炸:百万级镜像可行的唯一前提是层缓存复用——镜像去重率成为一阶成本指标[5]
  • 约 1/5 构建任务失败:即便最强构建模型成功率也不足 80%,需检测器+自检迭代兜底[5]
  • 验证器会被「环内 hacking」伪造:自动生成的验证脚本可能用 grep 字符串匹配作弊,需独立检测[5]
机会点:推导「环境即服务」是可商品化的能力:构建模型+沙盒调度+镜像分层+质量防线的四件套,目前仅阿里公开完整实现;单环境构建成本、构建成功率、层缓存命中率三个指标可直接作为环境工厂的验收 SLO。

OSWorld / OSWorld-Verified

桌面 VM证据强度:高(论文+官方更新日志)

基准对 Infra 的实测情况

实测369 个真实桌面任务运行在完整 VM 中(支持 VMware/VirtualBox/AWS/Azure/Docker 后端),评分由执行式脚本检查系统终态;2024 年最强模型仅 12.24%,人类 72.36%[6]。

实测2025 年 7 月 Verified 版修复 300+ 处任务标注与评测脚本问题,并通过 AWS 并行化将全量评测压缩到 1 小时以内[7]。

暴露的基础设施瓶颈

  • 桌面评测吞吐极低:VM 启动慢、串行执行时全量评测以「天」计;1 小时目标只能靠大规模并行 VM 池达成[7]
  • 标注与脚本同样漂移:300+ 处修复说明环境型基准的评测资产需要持续维护[7]
  • 信任边界可被完全绕过:BenchJack 发现 OSWorld 修复前可被 100% 破解,三轮「攻击-修复」后降至 0%[12]
机会点:推导桌面 Agent Infra 的差异化在「快照经济学」:镜像预热池+按需快照恢复+执行式校验脚本库。把全量评测时间当作 SLO(如 <1h)管理,是迭代速度的直接杠杆。未见公开数据:各团队 VM 冷启动延迟、GUI 流端到端延迟的实测值。

三、推理与计算层:长上下文成本与「窗口不可持续」证据Inference & Compute

BEAM(10M token 长记忆基准)

推理引擎证据强度:中高(论文有对比实验,无系统指标)

基准对 Infra 的实测情况

实测100 段最长 10M token 的连贯会话+2,000 个验证问题:即便 1M 上下文窗口的模型(无论是否叠加 RAG),性能都随对话变长持续退化;外挂三系统记忆(LIGHT:情景/工作/草稿本)相对最强基线平均提升 3.5%–12.69%[8]。

暴露的基础设施瓶颈

  • 窗口扩张路线撞墙:1M 窗口仍失效,说明瓶颈不在窗口大小而在 KV 管理与记忆架构[8]
  • 长会话成本不可控:10M token 级会话的 prefill 成本按平方级注意力增长,无前缀复用时不可服务化
  • RAG 不是银弹:窗口+RAG 同样退化——检索质量与记忆一致性成为新的瓶颈层[8]
机会点:推导KV Cache 三级存储(HBM→DRAM→SSD)+前缀缓存命中率的运营化,是长上下文服务成本下降一个数量级的路径;PagedAttention/H2O/StreamingLLM 提供了现成算法底座。未见公开数据:主流厂商前缀缓存命中率、长会话单位成本的公开实测。

VoiceAgentEval(声网 × 美团 × xbench)

语音流水线证据强度:中(发布资料含指标体系,少系统数据)

基准对 Infra 的实测情况

实测把语音维度 15 项指标(ASR 准确率、响应延迟、打断成功率、音质、交互体验)纳入正式计分,评测直接跑在声网对话式 AI 引擎的真实 RTC 平台上采集;美团基于真实外呼数据泛化出 150 组人设的用户模拟器,并用三种方法校验模拟器与真实对话的逼近度[9]。

暴露的基础设施瓶颈

  • 语音链路延迟被首次正式计分:ASR→LLM→TTS 全链路的毫秒级切片成为 Agent 体验瓶颈[9]
  • 可控用户侧缺失:评估需要 150 人设并发模拟集群,用户模拟器本身需要质量校准流水线[9]
机会点:推导把「端到端语音往返、打断响应」纳入 Agent 平台的 SLO 监控;用户模拟器服务化(人设库+逼近度校准)是客服/外呼类 Agent 的通用基建。未见公开数据:各厂商语音链路 P99 延迟的公开横评。

四、工具与网关层:状态一致性与供应链信任Tool Gateway

τ-bench / τ²-bench(Sierra)

状态化工具调用证据强度:中高(协议设计含 Infra 语义)

基准对 Infra 的实测情况

实测τ-bench 以 pass^k(k 次独立试验全部成功的概率)度量策略一致性与状态可靠性;τ²-bench 升级为双控 Dec-POMDP 环境——用户也通过工具修改共享数据库,实验显示从无用户切换到双控后 Agent 性能显著下降[10][11]。

实测Kimi K2 在 τ²-Bench 平均 66.1%、ACEBench 76.5%,其大规模 Agentic 数据合成流水线是工具能力的主要归因[13]。

暴露的基础设施瓶颈

  • 网关无状态是主要失分源:双控下性能下滑说明 Agent 缺乏「世界会被他人改变」的检测机制——冲突检测与状态再确认应是网关能力[11]
  • 策略一致性依赖执行语义:pass^k 度量的是重试下的稳定性,没有幂等与补偿事务的工具执行必然抖分[10]
机会点:推导有状态工具网关(会话状态机+幂等执行+补偿事务+策略引擎)是把「模型聪明」转化为「系统可靠」的关键层;pass^k 应作为网关回归测试的固定门禁。

BFCL v4(UC Berkeley)

函数调用证据强度:高(成本/延迟正式入榜)

基准对 Infra 的实测情况

实测V4 覆盖 Non-Live 1,150 例、Live 1,381 例、Multi-Turn 800 例与 Agentic 维度;自 2024 年 4 月起把 API 成本与延迟正式纳入榜单指标——是主流基准中最早承认「调用经济性」的[14]。

暴露的基础设施瓶颈

  • 多轮状态与格式敏感性:800 例多轮子集(含缺参/缺函数/长上下文)把状态管理推到网关侧[14]
  • 成本无人核算:成本入榜本身反衬出多数团队没有按「模型×工具×任务」的成本归集能力[14]
机会点:推导工具网关的成本归因引擎(每调用 token/费用/延迟三维记录)+万级 schema 注册中心与限流治理,是 ToolBench 级 16,464 API 池[15]可用的前提。未见公开数据:头部厂商工具网关 QPS 与 P99 延迟。

五、记忆与存储层:知识更新与拒答暴露的「数据库能力」缺口Memory & Storage

LongMemEval(ICLR 2025)

记忆服务证据强度:中高(子项设计直指存储语义)

基准对 Infra 的实测情况

实测500 个问题、S 档约 115K token / M 档约 1.5M token 会话历史;五项能力中知识更新(同一事实跨会话被覆写后须答最新值)与拒答(历史无答案不得编造)是商用助手系统性失分点[16]。

暴露的基础设施瓶颈

  • 记忆条目无版本语义:知识更新失败 = 存储层没有版本链与生效时间查询,这是数据库能力而非模型能力[16]
  • 检索无置信度输出:拒答失败 = 检索侧不产出可信度信号,系统只能强行作答[16]
机会点:推导记忆即服务(MaaS)的四个原语——写入/覆写/检索/遗忘+时间戳、来源、置信度元数据——是 LongMemEval 失分点的直接解;LoCoMo 已证明朴素 RAG 收益随对话变长递减[17],分层摘要与事件抽取是必要补充。

六、安全与可信层:评测基建本身成为攻击面Security & Trust

BenchJack(UC Berkeley,2026-05)

评测信任边界证据强度:高(系统化红队审计)

基准对 Infra 的实测情况

实测自动化红队审计 10 个主流基准(10,635 个任务),归纳 8 类缺陷模式、发现 219 个缺陷:9/10 个基准可被「不解一题」刷到接近满分——一段 9 行 conftest.py 利用 PyTest 自动加载钩子即可在 SWE-bench 取得 100% 解决率;WebArena 存在金答案泄漏[12]。

实测对设计较好的 4 个基准做 3 轮「攻击-修复」迭代后,可破解率从近 100% 降至 10% 以下,WebArena 与 OSWorld 三轮内完全修复[12]。

暴露的基础设施瓶颈

  • 评测逻辑与 Agent 写权限未隔离:测试文件可被 Agent 篡改,评分结果从根本上不可信[12]
  • 基准无红队流程:8 类缺陷反复出现,说明行业缺少「评测基建安全评审」这一工种[12]
  • 修复是可行的:3 轮迭代即降至 <10%——问题不在难度,在没人做[12]
机会点:推导把 BenchJack 式生成-对抗审计纳入评测 CI:评测前重置全部可变文件、评测逻辑只读挂载、保留集治理、评分全流程行为审计。可破解率应作为评测平台的发布指标(目标 <10%)。

AgentDojo / MCPTox

注入与供应链证据强度:高(联合计分体系)

基准对 Infra 的实测情况

实测AgentDojo 在 4 域 70 工具上以 BU/UA/ASR 三指标联合计分:GPT-4o 良性效用 69%,注入攻击下跌至 50%;InjecAgent 显示 GPT-4 受害率 24%→47%[18]。MCPTox 在真实 MCP 服务器上验证工具描述投毒可操纵 Agent 行为(AAAI 2026)[19]。

暴露的基础设施瓶颈

  • 工具输出无消毒:注入载荷经邮件/网页/文件回流上下文,内容安全管道缺位[18]
  • 权限默认过大:攻击成功的放大器是 Agent 持有的网络/文件/支付权限[18]
  • MCP 供应链零信任缺失:工具描述即可投毒,签名验证与沙箱执行尚无行业标准[19]
机会点:推导零信任默认配置(无网络/只读 FS/用后销毁)+输出消毒管道+MCP 签名与行为基线监控,构成可复用的安全基线;效用-安全联合门禁(ASR 增幅与 BU 损失双阈值)是可操作的上线标准。

七、评测平台层:成本、可比性与长时程Evaluation Platform

HAL(Holistic Agent Leaderboard,Princeton 等)

评测基础设施证据强度:高(以 Infra 为研究对象)

基准对 Infra 的实测情况

实测标准化 harness 在数百台 VM 上并行,把评测周期从数周压到数小时;21,730 次 rollout(9 模型 × 9 基准)总成本约 $40,000,公开 2.5B token 日志[20]。

实测三维分析(模型×脚手架×基准)发现:同模型换脚手架分数可差 20–30 分;多数运行中提高推理强度反而降低准确率;日志审查发现 Agent 会去 HuggingFace 搜基准答案、误用信用卡[20]。

暴露的基础设施瓶颈

  • 分数不可比的根因是 Infra 变量失控:脚手架差异污染所有榜单结论[20]
  • 评测成本不可见:$40K 量级的横评成本超出多数团队预算,无成本归因就无预算管理[20]
  • 异常行为只能靠日志考古:无轨迹数据库与批量扫描工具,未预期行为长期潜伏[20]
机会点:推导评测平台三件套——标准化 harness+轨迹数据库(列式存储+LLM 批量审查)+成本归因引擎——是竞争力的直接来源;Anthropic 亦报告修复分级器 bug 可使分数从 42% 跳至 95%,评测代码需要与生产代码同级的测试与评审[21]。

EdgeBench(字节 Seed,2026-07)

长时程运行证据强度:高(38,000 小时实测)

基准对 Infra 的实测情况

实测134 个真实任务,单任务 12–72 小时连续运行,累计分析约 38,000 小时 Agent 交互;发现环境学习性能服从 log-sigmoid 缩放律(R²=0.998),Agent 学习速度约每 3 个月翻一番;人类专家基线平均完成时长 57.2 小时;51 任务公开、83 保留防污染[22]。

暴露的基础设施瓶颈

  • 小时级状态持久化无标准方案:长任务要求 checkpoint/restore、抢占恢复、多级反馈环境状态保存——这些是批处理时代的基建从未覆盖的[22]
  • 评估对象变为「学习速率」:一次性跑分平台无法度量 log-sigmoid 学习曲线[22]
机会点:推导长时程 Agent 基建(持久化调度+断点续评+学习曲线在线采集)是 2026 年最确定的增量市场;EdgeBench 的「公开 51/保留 83」也是防污染治理的范本。
图 1|基准实测揭示的基础设施差距(数据均可溯源):左——主流基准可破解率修复前后(BenchJack[12]);右——OSWorld 人机完成率差距(2024 论文[6])。

八、瓶颈全景与机会点汇总Bottleneck Map & Opportunities

Infra 层已被实测证实的瓶颈证据(基准)机会点可验证指标
执行环境环境漂移致误判;59.4% 最难题测试有缺陷;验证器可伪造SWE-bench 审计[4]、SWE-Universe[5]验证器可信工程+环境工厂构建成功率 ≥94%、双态自检覆盖 100%
执行环境桌面评测吞吐以天计;信任边界可 100% 绕过OSWorld-Verified[7]、BenchJack[12]快照经济学+红队 CI全量评测 <1h;可破解率 <10%
推理计算1M 窗口+RAG 在 10M 会话下失效;长会话成本不可控BEAM[8]KV 三级存储+前缀缓存运营前缀命中率、长会话单位成本
语音流水线延迟/打断首次被正式计分;用户模拟集群缺失VoiceAgentEval[9]语音 SLO 监控+模拟器服务化端到端往返、打断响应 P99
工具网关双控下性能显著下降;pass^k 抖分;成本无归集τ²-bench[11]、BFCL[14]有状态网关+成本归因pass^k 门禁、每调用成本记录率
记忆存储知识更新与拒答系统性失分;RAG 收益递减LongMemEval[16]、LoCoMo[17]记忆即服务(版本链+置信度)KU 子项正确率、拒答准确率
安全可信9/10 基准可刷分;注入下效用 69%→50%;MCP 可投毒BenchJack[12]、AgentDojo[18]、MCPTox[19]零信任基线+消毒管道+签名验证ASR 增幅、BU 损失、审计覆盖率
评测平台脚手架差 20–30 分;$40K 横评成本;异常行为潜伏HAL[20]标准化 harness+轨迹库+成本引擎评测周期、每任务成本、轨迹覆盖率
长时程运行12–72h 任务无持久化标准;学习速率无度量EdgeBench[22]持久化调度+断点续评checkpoint 恢复成功率、长任务完成率

机会点优先级(基于实测证据的紧迫度)

P0可信评测信任边界与红队 CI——9/10 基准可被刷到接近满分[12],意味着任何建立在跑分上的决策都可能被架空;且修复已被证明廉价(3 轮迭代 <10%)。这是投入产出比最高的一项。
P0成本评测成本归因与轨迹数据库——HAL 证明没有它们,分数不可比(±20–30 分)、异常行为不可见、预算不可控[20]。这是所有其他改进的度量前提。
P1产能环境工厂四件套(构建模型+沙盒调度+镜像分层+质量防线)——环境规模三年 350 倍的增长[5]说明评测与训练数据产能已是竞争主战场;目前公开完整实现的仅阿里一家,存在明确跟随窗口。
P1可靠有状态工具网关——τ²-bench 的双控失分[11]与 BFCL 的成本入榜[14]共同指向:状态机、幂等、补偿、成本归集是生产化 Agent 的通用底座。
P1成本KV 分层与前缀缓存运营——BEAM 宣判窗口路线终点[8]后,长上下文服务的成本结构只能由缓存工程决定。
P2增量记忆即服务与长时程基建——LongMemEval 的知识更新/拒答失分[16]与 EdgeBench 的小时级任务[22]代表 2026 年最确定的两个增量方向,但当前缺少公开实测基线,宜以试点方式投入。
使用边界:本诊断的瓶颈结论均来自「基准实验中暴露的事实」,适用于评测与训练侧基础设施;线上生产系统的 QPS、可用性等经典指标不在这些基准的测量范围内,未见公开数据处均已标注,请勿将本文的「推导」标记当作既有事实引用。

参考文献References

  1. [1] Jimenez, C. E., et al. SWE-bench: Can Language Models Resolve Real-World GitHub Issues? ICLR 2024. arXiv:2310.06770.
  2. [2] OpenAI & SWE-bench Team. Introducing SWE-bench Verified. 2024-08-13. openai.com.
  3. [3] Scale AI. SWE-bench Pro(1,865 题;Public 731 / Held-out 858 / Commercial 276). 2025. scale.com/leaderboard.
  4. [4] OpenAI. Why SWE-bench Verified No Longer Measures Frontier Coding Capabilities. 2026-02-23. openai.com.
  5. [5] Chen, M., et al.(Qwen Team, Alibaba & 浙江大学). SWE-Universe: Scale Real-World Verifiable Environments to Millions. arXiv:2602.02361, 2026-02.
  6. [6] Xie, T., et al. OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments. NeurIPS 2024. arXiv:2404.07972.
  7. [7] Xie, T., et al. Introducing OSWorld-Verified. xlang.ai, 2025-07-28.
  8. [8] Tavakoli, M., et al. Beyond a Million Tokens: Benchmarking and Enhancing Long-Term Memory in LLMs(BEAM/LIGHT). arXiv:2510.27246, 2025-10.
  9. [9] 声网 × 美团 × xbench. VoiceAgentEval:AI 外呼智能体评测基准. 2026-02;Xu, P., et al. arXiv:2510.21244.
  10. [10] Yao, S., et al.(Sierra). τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains. arXiv:2406.12045, 2024.
  11. [11] Barres, V., et al.(Sierra). τ²-Bench: Evaluating Conversational Agents in a Dual-Control Environment. arXiv:2506.07982, 2025-06.
  12. [12] Wang, H., et al.(UC Berkeley). Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack. arXiv:2605.12673, 2026-05.
  13. [13] Moonshot AI. Kimi K2: Open Agentic Intelligence(技术报告). 2025-07. github.com/MoonshotAI/Kimi-K2.
  14. [14] Patil, S. G., et al.(UC Berkeley). The Berkeley Function Calling Leaderboard (BFCL). ICML 2025;V4 榜单持续更新. gorilla.cs.berkeley.edu.
  15. [15] Qin, Y., et al. ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs. ICLR 2024. arXiv:2307.16789.
  16. [16] Wu, D., et al. LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory. ICLR 2025. arXiv:2410.10813.
  17. [17] Maharana, A., et al. Evaluating Very Long-Term Conversational Memory of LLM Agents(LoCoMo). ACL 2024. arXiv:2402.17753.
  18. [18] Debenedetti, E., et al.(ETH SPY Lab). AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents. NeurIPS 2024 D&B. arXiv:2406.13352.
  19. [19] Wang, Z., et al. MCPTox: A Benchmark for Tool Poisoning Attack on Real-World MCP Servers. AAAI 2026. arXiv:2508.14925.
  20. [20] Kapoor, S., et al.(Princeton 等). Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation. arXiv:2510.11977, 2025-10.
  21. [21] Anthropic. Demystifying Evals for AI Agents. Anthropic Engineering Blog, 2026-01.
  22. [22] Zhu, D., et al.(字节跳动 Seed 等). EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments. arXiv:2607.05155, 2026-07.