Prefill-as-a-Service: KVCache of Next-Generation Models Could Go Cross-Datacenter
一、论文摘要
Prefill-decode (PD) 解耦已成为大规模 LLM 推理服务的标准架构,但其实际部署边界仍由 KVCache 传输决定。在传统密集注意力模型中,prefill 阶段产生巨大的 KVCache 流量,迫使 prefill 和 decode 紧密耦合在单一高带宽网络域内,限制了异构部署和资源弹性。近期混合注意力架构大幅减小了 KVCache 大小,使跨集群 KVCache 传输变得可行。然而,仅靠更小的 KVCache 并不足以实现异构跨数据中心 PD 服务:真实工作负载具有突发性、请求长度高度偏斜、前缀缓存分布不均、且跨集群带宽波动。 naive 地将所有 prefill 外置的设计仍可能遭受拥塞、不稳定排队和低利用率。
本文提出 Prefill-as-a-Service (PrfaaS),一种跨数据中心服务架构,选择性地将长上下文 prefill 卸载到独立的计算密集型 prefill 集群,并通过普通以太网将生成的 KVCache 传输到本地 PD 集群进行 decode。PrfaaS 将模型侧的 KV 效率与系统侧的选择性卸载、带宽感知调度和缓存感知请求放置相结合。该设计消除了异构加速器必须共享同一低延迟 RDMA 网络的要求,使 prefill 和 decode 容量能够在松散耦合的集群间独立扩展。在使用内部 1T 参数混合模型的案例研究中,PrfaaS 增强的异构部署比同质 PD 基线高 54% 的服务吞吐量,比 naive 异构基线高 32%,同时仅消耗适度的跨数据中心带宽。
二、基本信息
论文 ID: 2604.15039 标题: Prefill-as-a-Service: KVCache of Next-Generation Models Could Go Cross-Datacenter 作者: Ruoyu Qin, Weiran He, Yaoyu Wang, Zheming Li, Xinran Xu (Moonshot AI); Yongwei Wu, Weimin Zheng, Mingxing Zhang (Tsinghua University) 单位: Moonshot AI, Tsinghua University 会议/期刊: NeurIPS 2025 (preprint) 原文保存位置: ~/.openclaw/workspace/papers/20260421_PrfaaS/source/ 报告生成日期: 2026-04-21
三、论文主体分析
1. Introduction
1.1 背景与动机
Prefill-decode (PD) 解耦已成为大规模 LLM 推理服务的主导部署范式,因为它将推理的两个根本不同的阶段分离:prefill 主要是计算密集型,而 decode 主要是内存带宽密集型。Moonshot AI 的 Mooncake 通过将 KVCache 视为一等系统资源推动了这一转变,并通过与 vLLM、SGLang、Dynamo 等开源框架的合作在更广泛的 serving 生态中传播。
理论上,PD 解耦还应解锁一个更宏伟的目标:异构服务,即 prefill 在计算密集型加速器上运行,decode 在带宽优化型加速器上运行。硬件路线图已经在朝这个方向发展:NVIDIA Rubin CPX 明确针对高吞吐量长上下文 prefill,而 Groq LPU 等架构强调 decode 所需的极端内存带宽。
1.2 核心障碍:KVCache 传输
然而,这种异构愿景在实践中难以实现,因为当前 PD 解耦仍依赖强网络假设:当 prefill 和 decode 放置在不同节点时,prefill 产生的 KVCache 必须传输得足够快以避免阻塞计算。传统部署实际上将两个阶段限制在同一紧耦合的高带宽网络域内(通常是单个数据中心规模的 RDMA 网络)。
这种网络耦合阻止了异构服务的干净扩展:
- 高性能互连与机器形态和部署环境紧密耦合
- 将异构硬件强制放入单一紧耦合集群后,系统继承了固定的 prefill-to-decode 硬件比例
- 生产流量中请求混合、请求量和前缀缓存命中率持续波动,导致一侧过度配置而另一侧成为瓶颈
1.3 混合注意力架构的机遇
近期混合注意力架构以重要方式改变了这一局面。新兴模型(Kimi Linear、Qwen3.5、MiMo-V2-Flash、Ring-2.5-1T 等)将少量全注意力层与大量线性复杂度或有界状态层交错,大幅减少了相对于密集注意力架构的 KVCache 增长(通常一个数量级),从而使跨数据中心 KVCache 传输变得可行。
但可行性不等于实用性:naive 地将所有 prefill 外置的设计仍会因突发到达、偏斜的请求长度、不均匀的前缀缓存分布和波动的跨集群带宽而受损。
1.4 PrfaaS 核心设计
本文提出 Prefill-as-a-Service (PrfaaS),通过跨数据中心 KVCache 实现选择性卸载:
- 不强制异构加速器进入单一 RDMA 岛
- 构建独立的、 dedicated 的长上下文 prefill 集群
- 仅将长未缓存 prefill 卸载到这些计算密集型 prefill 集群
- 短请求保留在本地 PD 路径
- 生成的 KVCache 通过普通以太网传输到 decode 集群
三个关键系统机制:
- 基于长度的阈值路由:仅将足够长的请求卸载
- 带宽感知调度器:在拥塞积累前响应波动链路条件
- 全局 KVCache 管理器:联合考虑请求长度、缓存放置和可用跨集群带宽

图 1:两种 PD 解耦 LLM 服务部署范式对比。(a) 现状:紧耦合的单集群推理;(b) PrfaaS:通过跨数据中心 KVCache 的多集群解耦推理。
:::
1.5 主要结果
使用内部 1T 参数混合模型(Kimi Linear 架构)的案例研究:
- 比同质 PD 基线高 54% 的服务吞吐量
- 比 naive 异构基线高 32% 的吞吐量
- 仅消耗适度的跨数据中心带宽
2. Background
2.1 传统 PD 解耦中的带宽墙
PD 解耦将推理分离为计算密集型的 prefill 阶段和内存带宽密集型的 decode 阶段。但一旦 prefill 和 decode 放置在不同节点,每个请求必须将其 KVCache 从 prefill 侧导出到 decode 侧。
KV 吞吐量定义:
$$\Phi_{\text{kv}}(l) = \frac{S_{\text{kv}}(l)}{T_{\text{prefill}}(l)}$$其中 $S_{\text{kv}}(l)$ 是长度为 $l$ 的请求的 KVCache 大小,$T_{\text{prefill}}(l)$ 是对应的 prefill 延迟。
对于传统密集注意力架构,这种传输需求是主导性系统约束。在标准 Transformer 注意力中,KVCache 随上下文长度线性增长,可达数十 GB。
| 模型 | Attention Type A | Attention Type B | A:B 比例 | 模型参数 |
|---|---|---|---|---|
| Kimi Linear | KDA | MLA | 3:1 | 48B |
| MiMo-V2-Flash | SWA | GQA | 5:1 | 309B |
| Qwen3.5-397B | GDN | GQA | 3:1 | 397B |
| Ring-2.5-1T | Lightning | MLA | 7:1 | 1T |
| MiniMax-M2.5 | -- | GQA | -- | 229B |
| Qwen3-235B | -- | GQA | -- | 235B |
表 1:代表性模型的配置。Type A 表示线性复杂度块,Type B 表示二次复杂度全注意力块。

图 2:MiniMax-M2.5 在 8×H200 实例上不同输入长度下的 KV 吞吐量。
:::
对于 32K token 请求,单个 MiniMax-M2.5 实例以约 60 Gbps 的速率产生 KVCache,需要的出口带宽远超典型机器的跨数据中心以太网容量。这正是为什么传统 PD 解耦在操作上仍与紧集成网络域绑定。
| 机制 | Prefill 延迟 | KV 吞吐量 |
|---|---|---|
| GQA | 高 | 高 |
| MLA | 高 | 低 |
| Sparse Attention | 低 | 高 |
| SWA | 低 | 低 |
| Linear Attention | 低 | 低 |
表 2:不同注意力机制的 prefill 延迟和 KV 吞吐量特征。两个指标都是越低越好。
2.2 混合注意力改变 PD 部署边界
改变局面的不是新调度器,而是模型架构的转变。主流注意力改进沿两个维度分类:prefill 延迟 ($T_{\text{prefill}}$) 和 KV 吞吐量 ($\Phi_{\text{kv}}$)。
越来越多的旗舰开源模型采用线性注意力或 SWA,将其组合成交错少量全注意力层和大量线性复杂度层的混合栈。代表性例子:
- Qwen3.5-397B:3:1 线性到全注意力比例
- MiMo-V2-Flash:5:1 SWA 到全注意力比例
- Ring-2.5-1T:7:1 线性到全注意力比例
在这些架构中,只有全注意力层产生随序列长度扩展的 KVCache,而线性复杂度层保持固定大小的循环状态。
| Seq Len | Kimi Linear | MiMo-V2-Flash | Qwen3.5-397B | Ring-2.5-1T | MiniMax-M2.5 | Qwen3-235B |
|---|---|---|---|---|---|---|
| 1K | 1.19 | 0.82 | 4.13 | 7.27 | 4.94 | 4.12 |
| 8K | 2.29 | 2.85 | 6.28 | 4.47 | 32.87 | 22.42 |
| 32K | 3.87 | 4.66 | 8.25 | 2.59 | 59.93 | 33.35 |
| 128K | 4.88 | 4.71 | 7.47 | 1.46 | 47.82 | 21.50 |
表 3:不同输入长度下的 KV 吞吐量 $\Phi_{\text{kv}}$ (Gbps)。所有模型在 8×H200 上使用 SGLang v0.5.9 测试。
与相似大小的密集模型相比,混合模型的 $\Phi_{\text{kv}}$ 急剧降低:
- MiMo-V2-Flash 在 32K 时:4.66 Gbps vs MiniMax-M2.5 的 59.93 Gbps(13× 降低)
- Qwen3.5-397B 在 32K 时:8.25 Gbps vs Qwen3-235B 的 33.35 Gbps(4× 降低)
- Ring-2.5-1T:MLA 贡献约 4.5× 压缩,7:1 混合比例贡献约 8× 降低,总体 KV 内存节省约 36×
关键系统含义:降低的 KV 吞吐量将 PD 解耦的可部署网络边界从 RDMA 级网络转移到普通以太网。
2.3 从数据中心内 PD 到 PrfaaS 范式
集群级带宽需求:
$$B_{\text{out}} = \frac{N}{P} \cdot \frac{\mathbb{E}[S_{\text{kv}}]}{\mathbb{E}[T_{\text{prefill}}]} \approx \frac{N}{P} \cdot \Phi_{\text{kv}}(L_{\text{avg}})$$其中 $P$ 是并行度(每实例 GPU 数),$L_{\text{avg}}$ 是实际卸载到 PrfaaS 集群的请求的平均未缓存输入长度。
$B_{\text{out}}$ 不仅取决于由模型架构和硬件决定的 $\Phi_{\text{kv}}$,还取决于由请求长度分布、前缀缓存命中率和路由策略决定的 $L_{\text{avg}}$。
对于 512 H200 GPU 的 prefill 集群,$L_{\text{avg}} = 32K$:
- MiniMax-M2.5 和 Qwen3 分别需要 3.8 Tbps 和 2.1 Tbps 出口带宽
- Ring-2.5-1T 仅需约 170 Gbps
- 路由更长请求(128K tokens)时,带宽需求进一步降至 100 Gbps 以下
- 即使万 GPU 数据中心规模,总出口带宽仅约 1.8 Tbps
这是系统转折点:一旦 KV 吞吐量降到足够低,异构服务不再需要作为同一 RDMA 岛后尴尬共置的形式实现。相反,prefill 可以选择性地外置到独立的计算密集型 PrfaaS 集群,而 decode 保留在传统的带宽优化型 PD 集群中。
3. Disaggregation over Cross-Datacenter KVCache
3.1 Overview
跨数据中心 KVCache 的核心思想不是外置每个 prefill,而是选择性地将解耦的 LLM 服务扩展到单集群边界之外。
PrfaaS-PD 架构包含三个子系统:
计算子系统:
- 本地 PD 集群:执行 PD 解耦服务,可端到端完成推理
- PrfaaS 集群:为增量未缓存长度超过路由阈值的长上下文 prefill 提供选择性远程 prefill 容量
网络子系统:
- 集群内网络:RDMA 用于延迟敏感的集合通信和 PD KVCache 传输
- 集群间链路:VPC 对等或专线用于跨数据中心 KVCache 传输
存储子系统:
- 分布式混合前缀缓存池
- 全局 KVCache 管理器维护跨所有集群的 KVCache 元数据

图 3:PrfaaS-PD 架构的部署拓扑。专用 PrfaaS 集群在成本效益高的高吞吐量加速器上执行计算密集型长上下文 prefill,并通过普通以太网将生成的 KVCache 流式传输到本地 PD 集群,而短请求或带宽不友好的请求保留在本地 PD 路径上。
:::
全局调度器基于请求特征、网络条件和缓存分布将请求路由到集群和节点。
3.2 Hybrid Prefix Cache Pool
传统前缀缓存池为单一 KVCache 类型设计。在混合模型中:
- 线性注意力或 SWA 层的循环状态是请求级的:大小与输入长度无关,仅在缓存长度完全匹配时才能重用
- 全注意力层的 KVCache 是块级的:随输入长度线性增长,支持部分前缀匹配
基于 vLLM 的混合 KVCache 管理器,本文构建了针对跨集群 KVCache 传输的混合前缀缓存系统:
- 线性状态和全注意力 KVCache 由独立的 KVCache 组管理,块大小对齐
- 所有组从共享的 KVCache 池分配和释放块
- 缓存块分为两类:
- 前缀缓存块:必须完全填充后才能跨请求重用(仅集群内)
- 传输缓存块:持有 prefill 请求尾部产生的 KVCache 用于 PD 解耦传输,传输完成后丢弃

图 4:混合前缀缓存池。线性状态和全注意力 KVCache 由独立组管理, backed by 统一块池。块分为前缀缓存(仅集群内,块对齐)和传输缓存(跨集群,传输后丢弃)。
:::
当新请求到达时,全局 KVCache 管理器计算每个集群的前缀匹配信息,请求路由器使用此信息选择 prefill 集群和其中的缓存亲和节点。KVCache 管理器还执行缓存再平衡以缓解热点。
3.3 PrfaaS-PD Disaggregation
PrfaaS 集群作为无状态 KVCache 生产者,其有效吞吐量等于 prefill 计算速率和网络出口带宽的最小值。
基于长度的路由策略:
- 设 $l$ 为请求的增量 prefill 长度(排除任何缓存前缀),$t$ 为路由阈值
- 当 $l > t$:请求路由到 PrfaaS 集群,完成后 KVCache 传输到 decode 节点
- 当 $l \leq t$:请求由 PD 集群内的 prefill 节点处理
随着 agentic 工作负载的普及,大多数请求是带有前缀缓存命中的增量 prefill。全局 KVCache 管理器跟踪所有缓存条目的存储位置,确保仅增量部分跨集群传输。
实现稳定高吞吐量以太网传输:
- 层间 prefill 流水线:重叠 KVCache 生成与传输
- 多连接 TCP 传输:充分利用可用带宽
- 拥塞监控:与调度器集成,早期检测丢包和重传信号,防止拥塞积累
3.4 Modeling and Scheduling
3.4.1 Throughput Model
PrfaaS-PD 系统包含三个角色:PrfaaS prefill、PD-P(PD 集群内的 prefill 节点)、PD-D(PD 集群内的 decode 节点)。
| 符号 | 含义 | 符号 | 含义 |
|---|---|---|---|
| 请求到达率(吞吐量) | $N_{\text{prfaas}}$PrfaaS prefill 实例数 | ||
| 未缓存输入长度(随机变量) | $N_p$, $N_d$ | PD-P / PD-D 实例数 | |
| 路由阈值 | $B_{\text{out}}$PrfaaS 出口带宽 | ||
| $\mathbb{E}[L \mid L > t]$,PrfaaS 平均长度 | $BS_{\max}$最大 decode batch size | ||
| $\mathbb{E}[L \mid L \leq t]$,PD-P 平均长度 | $T_{\text{prefill}}(l)$长度 $l$ 的 prefill 时间 | ||
| $P(L > t)$,到 PrfaaS 的比例 | $T_{\text{decode}}$每步 decode 时间 | ||
| 平均输出长度 | $\Theta_{\text{prfaas}}$PrfaaS 吞吐量 (req/s) | ||
| 长度 $l$ 的 KVCache 大小 | $\Theta_{\text{pd-p}}$, $\Theta_{\text{pd-d}}$ | PD-P / PD-D 吞吐量 (req/s) |
表 4:PrfaaS-PD 吞吐量模型中使用的符号。
PrfaaS 集群吞吐量(层间 prefill 流水线后,由计算和出口传输的较慢者决定):
$$\Theta_{\text{prfaas}} = \min\left(\frac{N_{\text{prfaas}}}{T_{\text{prefill}}(l_{\text{long}})},\; \frac{B_{\text{out}}}{S_{\text{kv}}(l_{\text{long}})}\right)$$PD-P 吞吐量(集群内 RDMA 带宽不是瓶颈):
$$\Theta_{\text{pd-p}} = \frac{N_p}{T_{\text{prefill}}(l_{\text{short}})}$$PD-D 吞吐量:
$$\Theta_{\text{pd-d}} = \frac{N_d \cdot BS_{\max}}{T_{\text{decode}} \cdot L_{\text{out}}}$$端到端系统吞吐量(由最慢阶段限制,考虑路由分割):
$$\Lambda_{\max} = \min\left(\frac{\Theta_{\text{prfaas}}}{p},\; \frac{\Theta_{\text{pd-p}}}{1 - p},\; \Theta_{\text{pd-d}}\right)$$3.4.2 Throughput-Optimal Configuration
给定固定硬件资源 ($N_{\text{prfaas}}$, $N_p + N_d$) 和网络带宽 $B_{\text{out}}$,优化两个决策变量:
- 路由阈值 $t$(决定 $p$, $l_{\text{long}}$, $l_{\text{short}}$)
- PD 集群 prefill-to-decode 比例 $N_p / N_d$
最优阈值平衡(使 PrfaaS 和 PD-P 同时接近饱和):
$$\frac{\Theta_{\text{prfaas}}}{p} = \frac{\Theta_{\text{pd-p}}}{1 - p}$$最优 PD 比例(使总生产者吞吐量与消费者吞吐量平衡):
$$\Theta_{\text{prfaas}} + \Theta_{\text{pd-p}} = \Theta_{\text{pd-d}}$$通过网格搜索高效找到最优工作点。
3.4.3 Dual-Timescale Scheduling
短期:带宽和缓存感知路由
- 持续监控 PrfaaS 出口利用率和请求队列深度
- 当利用率接近阈值或排队激增时,触发短期路由调整
- 基于增量 prefill 长度分布搜索最优阈值 $t$
- 对于前缀缓存命中的请求,联合考虑缓存亲和性和带宽可用性:
- 带宽稀缺时:各集群前缀缓存独立评估
- 带宽充裕时:考虑所有集群中的最佳缓存,可执行跨集群缓存传输
长期:流量驱动的资源重分配
- 监控各阶段的队列深度和利用率,识别绑定约束
- 定期重新评估负载平衡,在 PD 集群内转换 prefill 和 decode 角色
- 调整 $N_p$ 和 $N_d$ 恢复最优条件
- 实例数变化时,重新优化路由阈值 $t$
4. Case Study: Bandwidth Demand of PrfaaS-PD Architecture
4.1 Setup
使用内部 1T 参数混合架构模型作为案例研究:
- 架构遵循 Kimi Linear,3:1 KDA:MLA 比例
- 部署在两个通过 VPC 网络连接的集群,跨集群带宽约 100 Gbps
- PrfaaS 集群:32 H200 GPU(更高计算吞吐量)
- 本地 PD 集群:64 H20 GPU,800 Gbps RDMA 互连
- 基线:96 H20 GPU 同质 PD 集群
请求长度服从截断对数正态分布 ($\mu = 9.90$, $\sigma = 1.00$, 截断到 $[128, 128K]$),均值约 27K tokens。输出长度固定 1024 tokens,SLO 为 40 tokens/s。
| Seq Len | KVCache Size | Prefill Latency | KV Throughput |
|---|---|---|---|
| 1K | 190.8 MiB | 0.44 s | 3.61 Gbps |
| 8K | 308.9 MiB | 0.72 s | 3.59 Gbps |
| 32K | 701.3 MiB | 1.84 s | 3.19 Gbps |
| 128K | 2316.3 MiB | 7.40 s | 2.62 Gbps |
表 5:内部 1T 混合模型在不同输入长度下的 KVCache 大小、prefill 延迟和 KV 吞吐量。在 8×H200 上使用内部 vLLM 测试。
4.2 Throughput Modeling and Solution
使用 PrfaaS-PD 吞吐量模型优化路由阈值 $t$ 和 PD 集群 prefill/decode 分配。

图 5a:prefill/decode 分配搜索。固定 $t$ 在最优值,搜索本地 PD 集群内的 prefill/decode 实例分割。
:::

图 5b:路由阈值 $t$ 搜索。固定 $N_p = 3, N_d = 5$,搜索 $t$。
:::
最优配置:
- 路由阈值 $t = 19.4$K
- 本地 PD 集群:$N_p = 3$, $N_d = 5$
- 约 50% 请求(较长者)卸载到 PrfaaS 集群
| Metric | PrfaaS-PD | Homogeneous PD | Naive Heterogeneous PD |
|---|---|---|---|
| Threshold $t$ | 19.4K | --- | --- |
| $N_{\text{prfaas}}$ / $N_p$ / $N_d$ | 4 / 3 / 5 | --- / 9 / 3 | 4 / --- / 8 |
| Mean / P90 TTFT (s) | 2.22 / 3.51 | 4.44 / 9.73 | 1.74 / 3.51 |
| $\Theta_{\text{prfaas}}$ / $\Theta_{\text{pd-p}}$ / $\Theta_{\text{pd-d}}$ (req/s) | 1.61 / 1.64 / 3.91 | --- / 2.11 / 2.35 | 2.45 / --- / 6.25 |
| $\Lambda_{\max}$ (req/s) | 3.24 | 2.11 | 2.45 |
| Ratio | 1.54× | 1.00× | 1.16× |
表 6:PrfaaS-PD、同质 PD 和 naive 异构 PD 部署的最优配置对比。
4.3 Result Analysis
跨数据中心带宽利用率:
- 路由阈值 $t = 19.4$K 时,49.6% 请求路由到 PrfaaS
- 卸载子集的 $\mathbb{E}[L \mid L > t] \approx 44$K tokens
- PrfaaS 集群总出口负载约 13 Gbps,仅占 100 Gbps 以太网链路的 13%
- 确认混合架构模型的 KVCache 可通过普通以太网传输,且有充足余量
与同质 PD 对比:
- 吞吐量提升 54%
- P90 TTFT 降低 64%
- 均值 TTFT 降低 50%
- 长请求被卸载到专用高吞吐量 PrfaaS 集群,避免与短请求竞争 prefill 容量
与 naive 异构 PD 对比:
- naive 异构 PD(无调度优化,所有 prefill 分配给 H200,所有 decode 给 H20)仅比同质基线高 1.16× 吞吐量
- PrfaaS-PD 比 naive 异构高 32%
- 性能下降源于 prefill 和 decode 吞吐量严重不平衡,以及将异构 prefill 作为通用路径而非选择性卸载
5. Discussion
KVCache-friendly 模型架构:随着上下文窗口持续增长,KVCache 在存储和传输中主导推理成本。MLA、SWA、线性注意力等技术已证明 KVCache 大小可在不牺牲模型能力的情况下大幅减小。模型协同设计可能不仅优化 FLOPs 还优化 KVCache 传输量。
KVCache 压缩和重用:H2O、KIVI 选择性驱逐或量化 KVCache;CacheGen 应用传统压缩技术;CacheBlend 和 FusionRAG 实现近似匹配的 KVCache 跨请求重用。这些技术与 KVCache-friendly 模型设计互补。
阶段专用推理硬件:
- NVIDIA Rubin CPX 强调 prefill 计算吞吐量
- Groq LPU 和 Taalas HC1 强调 decode 内存带宽
- 跨数据中心 KVCache 自然契合这一趋势,允许运营商独立调整 prefill 和 decode 集群规模
6. Related Work
PD 解耦:Splitwise 和 DistServe 分别从成本/功耗和 goodput 角度形式化 PD 解耦。
异构部署:Helix、Hetis、LLM-PQ 将异构 GPU/网络和阶段级差异纳入优化空间。
资源重配置:DynamoLLM 和 FREESH 从能耗、成本和碳效率角度强调系统级资源重配置。
KVCache 管理:Mooncake 引入全局 KVCache 池;CacheBlend 和 FusionRAG 通过非前缀 KVCache 融合重用显著降低 TTFT;KIVI、KVQuant、H2O 通过量化或基于重要性的驱逐缩小 KVCache 体积。
本文差异:没有先前工作联合优化跨数据中心 prefill 卸载、异构部署和带宽/缓存感知调度。本文从跨数据中心 KVCache 角度,将解耦推理与异构资源编排结合。
7. Conclusion
本文提出跨数据中心 KVCache 概念,将解耦服务从单一同质集群扩展到跨集群异构部署。在此基础上设计了 PrfaaS-PD 解耦架构,通过普通以太网连接异构 PrfaaS 集群,以低成本增强系统服务吞吐量。跨数据中心 KVCache 范式将与下一代模型、硬件和网络协同演进,实现大规模高效 LLM 服务。
四、论文简评
创新点
跨数据中心 KVCache 范式:首次系统性地提出并论证了跨数据中心 PD 解耦的可行性,打破了传统 PD 必须局限于单一 RDMA 域的假设。
PrfaaS-PD 架构设计:将模型侧 KVCache 效率与系统侧选择性卸载、带宽感知调度和缓存感知请求放置相结合,形成完整的端到端解决方案。
双时间尺度调度算法:分离短期路由决策和长期资源重分配,有效应对流量突发和带宽波动。
混合前缀缓存池:针对混合注意力架构的特点,设计了支持跨集群传输的混合缓存管理系统。
吞吐量建模与优化:建立了 PrfaaS-PD 系统的解析吞吐量模型,并通过网格搜索找到最优配置。
局限性
评估规模有限:案例研究仅使用 32 H200 + 64 H20 GPU 的部署,更大规模(如千 GPU 级)的实际表现有待验证。
工作负载单一:使用固定输出长度(1024 tokens)和单一分布,未覆盖多模态、多租户等复杂场景。
网络假设简化:假设稳定的跨集群带宽,未深入探讨网络故障、分区等极端情况。
硬件选择代表性:H200/H20 只是代表性硬件对,其他异构组合(如 CPU/GPU、不同厂商加速器)的适用性未讨论。
应用场景
大规模 LLM 云服务:允许云厂商在不同数据中心独立扩展 prefill 和 decode 容量,优化成本结构。
边缘-云协同推理:将长上下文 prefill 卸载到云端计算集群,decode 在边缘设备执行。
混合云部署:利用公有云的弹性计算资源处理突发 prefill 负载,私有云处理常规 decode。
新一代模型部署:随着 Kimi Linear、Ring-2.5-1T 等混合架构模型的普及,PrfaaS 架构可直接应用。
可改进方向
动态带宽适应:当前调度器主要基于利用率阈值,可引入更精细的拥塞控制机制(如类似 TCP 的 AIMD)。
多租户公平性:在共享 PrfaaS 集群场景中,需要资源隔离和公平调度机制。
容错与恢复:跨数据中心链路的故障恢复、KVCache 传输中断后的重试机制。
与压缩技术结合:将 KVCache 压缩(如 CacheGen)与 PrfaaS 架构结合,进一步降低带宽需求。
在线学习优化:基于实际流量模式在线学习最优阈值 $t$ 和分配比例,而非离线网格搜索。