RAGO
Systematic Performance Optimization for Retrieval-Augmented Generation Serving
📋 论文基本信息
| 正式标题 | RAGO: Systematic Performance Optimization for Retrieval-Augmented Generation Serving |
|---|---|
| 作者机构 | 谷歌 DeepMind, 加州大学圣地亚哥分校 (UCSD) |
| 核心定位 | 业界首篇针对 RAG 服务端的全链路系统化异构资源优化研究 |
| 开源支撑 | 提供完整的 Artifact 开源项目,可直接复现实验效果 |
🎯 RAG 技术的产业价值
RAG 是解决纯大模型(LLM-only)三大固有缺陷的 industry standard 技术路径:
- 知识时效性 — 低成本增量更新
- 事实幻觉风险 — 外部数据源可溯源
- 部署成本 — 小模型+检索
⚠️ 现有技术的研究缺口
当前优化聚焦于检索算法本身,采用与传统 LLM 服务端完全一致的纯拆分部署架构,无法覆盖 RAG 流水线的复杂度。
1. 多组件异构性缺口 — 缺乏对向量检索、查询重写、重排、推理等多类型异构负载的统一调度机制。
2. 工作负载可变性缺口 — 缺乏标准化的工作负载抽象,无法对不同 RAG 配置的性能做横向对比与系统化优化。
3. 流水线阻塞性缺口 — 迭代检索导致推理流水线频繁切换,现有策略未考虑跨阶段依赖关系,易出现资源空闲。
🧩 核心设计原则
抽象
工作负载标准化
量化
开销与瓶颈建模
自动化
系统化优化框架
📐 RAGSchema: 标准化负载抽象
业界首个面向服务端性能优化的 RAG 工作负载结构化抽象,解决了性能不可比、优化无基准的难题。
| 属性维度 | 内容 |
|---|---|
| 检索侧属性 | 向量库规模、topK、文档长度... |
| 流水线侧属性 | 查询重写、重排、迭代检索频率... |
| 资源侧属性 | CPU/GPU 规模、存储类型、网络延迟... |
四类典型 RAG 范式
- 超大规模检索 (Hyperscale Retrieval)
- 长上下文排序 (Long-Context Sequence Processing)
- 解码中迭代检索 (Iterative Retrievals + Prefix)
- 带查询重写+重排序的完整流水线
🔍 四类场景瓶颈分析
场景一:超大规模检索
亿级至千亿级向量库,高并发,topK>100
• 检索阶段开销占比 >60%
• 瓶颈在 CPU 侧(计算、IOPS、内存带宽)
• 批处理规模失衡导致资源空闲
• 检索阶段开销占比 >60%
• 瓶颈在 CPU 侧(计算、IOPS、内存带宽)
• 批处理规模失衡导致资源空闲
核心结论:检索效率直接决定系统吞吐量上限
场景二:长上下文排序
单文档 >1000 token,总长度 >4096 token
• 前缀阶段开销占比 >50%
• 1:1 资源分配比例完全不匹配
• KV-cache 传输放大内存带宽瓶颈
• 前缀阶段开销占比 >50%
• 1:1 资源分配比例完全不匹配
• KV-cache 传输放大内存带宽瓶颈
核心结论:前缀阶段 GPU 资源配比对性能影响最大
场景三:解码中迭代检索
解码阶段触发多轮检索,单轮对话检索 >2 次
• 流水线阻塞空闲是核心瓶颈
• 批处理比例失衡导致延迟高 2.77 倍
• 网络传输延迟被多轮迭代放大
• 流水线阻塞空闲是核心瓶颈
• 批处理比例失衡导致延迟高 2.77 倍
• 网络传输延迟被多轮迭代放大
核心结论:批处理比例失衡比检索延迟更严重
场景四:完整流水线
含 8B 查询重写模型、120M 重排模型
• 查询重写是 TTFT 延迟核心来源 (+140%)
• 重排模块影响可忽略 (<5%)
• 小模型部署位置放大网络依赖
• 查询重写是 TTFT 延迟核心来源 (+140%)
• 重排模块影响可忽略 (<5%)
• 小模型部署位置放大网络依赖
核心结论:小模型的部署策略对端到端延迟影响巨大
⚙️ RAGO 系统化优化框架
业界首个覆盖 RAG 全链路的异构资源优化调度框架,核心是 "混合协同-拆分调度策略"。
| 策略 | 内容 |
|---|---|
| 任务放置 | 强拆分(主 LLM 前缀/解码)· 协同部署(计算密集型)· 弱拆分(强依赖阶段) |
| 资源分配 | 计算密集型→高算力 GPU/TPU · 内存密集型→高带宽内存 · 检索→多核 CPU |
| 批处理策略 | 延迟敏感→小批量(TTFT 优先)· 吞吐敏感→大批量 · 检索→动态调整与解码对齐 |
📊 核心实验结果
2x
单芯片 QPS 提升
-55%
TTFT 延迟降低
-60%
硬件成本降低
-70%
流水线等待消除
在四类场景下均保持稳定正向优化,且没有牺牲任何检索精度或生成质量。
🚀 行业落地价值
- 支撑成本与体验平衡
- 提供部署最佳实践
- 现有流水线无侵入集成
- 适配 Agent 场景优化
- 验证"小模型+检索"范式
⚠️ 技术局限性
| 局限 | 说明 |
|---|---|
| 场景覆盖限制 | 未覆盖复杂 Agentic RAG 场景(多工具编排、长时自治任务) |
| 部署环境限制 | 仅考虑单集群内调度,未覆盖多集群、跨可用区部署 |
| 优化维度限制 | 未覆盖向量检索算法本身及存储层硬件级优化 |
| 调度目标限制 | 未将能耗、硬件成本、SLA 优先级纳入成本模型 |
🔭 后续研究方向
- 场景扩展 — 覆盖更复杂的 Agentic AI 流水线负载特征
- 算法-系统协同优化 — 整合向量检索算法级优化与系统级调度
- 调度目标多元化 — 纳入能耗、成本、SLA 优先级、网络波动
- 硬件架构定制 — 针对存算一体、近数据计算等新硬件定制策略
💡 核心结论
方法论价值:建立了一套从工作负载抽象、到瓶颈建模、再到异构资源协同调度的完整系统化优化方法论,填补了 RAG 技术在算法层与系统层之间的优化缺口。
关键技术结论:
- RAG 系统需采用 混合协同-拆分的调度策略,不能照搬 LLM-only 方案
- 不同场景核心瓶颈差异极大,需通过 标准化负载抽象精准定位
- 批处理比例对齐是优化迭代检索场景性能的关键
- 系统化调度优化可使"小模型+RAG"性能 超越超大参数纯 LLM 方案
本页面由 AI 辅助整理,基于用户提供的 RAGO 论文分析材料。
⚠️ 免责声明
本站内容均由 AI 基于公开知识辅助生成,仅供学习参考,请勿直接引用作为依据。作者不对信息的准确性、完整性及适用性作保证,亦不对因使用本站内容产生的任何损失承担责任。