负载规模实测 MLCommons / 字节 Seed / 普林斯顿
MLPerf 单条轨迹上下文 262,144 token;EdgeBench 单任务最多 200 轮交互、超 10 万 token;BEAM 会话规模 1,000 万 token;HAL 公开 Agent 日志 25 亿 token。
容量价值的实验证据
EdgeBench 论文第 5.2/5.3 节 · 专题分析
100 万与 20 万 token 上下文对比:成绩全程稳定高出 4.4–5.8 分;保持经验连续(会话状态不丢失)在同等预算下高出 6.9 分——状态容量可以直接折算为任务成绩。
缓存复用计入评分 MLCommons / Artificial Analysis
两项服务级评测均明确允许 KV Cache 复用、推测解码与分离式推理——缓存工程的优劣从后台实现细节转变为榜单成绩的组成部分。