Prefill-as-a-Service: Cross-Datacenter KVCache for Next-Gen LLMs¶
Szerzők: Ruoyu Qin, Weiran He, Yaoyu Wang, Zheming Li, Xinran Xu, Yongwei Wu, Weimin Zheng, Mingxing Zhang
Intézmény: Moonshot AI, Tsinghua Egyetem
Dátum: 2026. április 22.
arXiv: 2604.15039v1
Link: https://arxiv.org/abs/2604.15039v1
Összegzés¶
A Prefill-Decode (PD) disaggregáció az LLM serving standardja, de a KVCache átviteli sávszélesség korlátozza a telepítést egyetlen adatközpontra. A hibrid attention architektúrák jelentősen csökkentik a KVCache méretét, lehetővé téve a cross-datacenter átvitelt. A PrfaaS (Prefill-as-a-Service) architektúra szelektíven offload-olja a hosszú kontextusú prefilleket külön compute-dense cluster-ekbe, és a KVCache-t commodity Etherneten keresztül továbbítja a helyi decode cluster-eknek.
Probléma¶
KVCache szűk keresztmetszet¶
- Dense attention modellek: KVCache lineárisan nő a szekvencia hosszával
- MiniMax-M2.5, 32K token: ~60 Gbps példányonként → RDMA szükséges
- Ez egyetlen adatközpontra korlátozza a PD telepítést
Hibrid attention architektúrák¶
- Teljes attention rétegek keverése lineáris komplexitású rétegekkel
- Példák: Kimi Linear (3:1), MiMo-V2-Flash (5:1), Ring-2.5-1T (7:1)
- KVCache 4-13× kisebb → cross-datacenter átvitel lehetséges
PrfaaS architektúra¶
Komponensek¶
- PrfaaS cluster-ek — standalone compute-dense cluster hosszú prefillekhez
- Helyi PD cluster-ek — hagyományos PD serving rövid prefillekhez és decode-hoz
- Hálózat — intra-cluster RDMA + inter-cluster VPC/dedikált Ethernet
- Hibrid prefix cache pool — külön kezelt linear states és full-attention KVCache
Szelektív offloading¶
- Hossz-alapú routing küszöb: csak l > t kerül PrfaaS-be
- Rövid kérések maradnak helyi PD úton
- Optimális küszöb: t = 19.4K token (~50% kérés offloaded)
Sávszélesség-tudatos ütemezés¶
- Egress kihasználtság és sorhossz monitorozás
- Dinamikus küszöb beállítás torlódáskor
- Layer-wise prefill pipelining + multi-connection TCP
Eredmények (1T paraméterű hibrid modell)¶
| Metrika | PrfaaS-PD | Homogén PD | Naiv Heterogén |
|---|---|---|---|
| Áteresztőképesség | 3.24 req/s | 2.11 req/s | 2.45 req/s |
| Relatív | 1.54× | 1.00× | 1.16× |
| Mean TTFT | 2.22 s | 4.44 s | 1.74 s |
| P90 TTFT | 3.51 s | 9.73 s | 3.51 s |
- 54% magasabb áteresztőképesség homogén PD-hez képest
- 32% magasabb naiv heterogén PD-hez képest
- Cross-datacenter sávszélesség: csak ~13 Gbps (13% a 100 Gbps linkből)
Hardver implikációk¶
Fázis-specializált hardver¶
- NVIDIA Rubin CPX: compute throughput prefill-hez
- Groq LPU / Taalas HC1: extrém memória sávszélesség decode-hoz
- Cross-datacenter KVCache = nincs szükség közös RDMA fabric-re
- Független skálázás prefill és decode kapacitásra
Sávszélesség igények¶
| Modell | 32K token | 128K token | 10K GPU DC |
|---|---|---|---|
| Dense (MiniMax) | 3.8 Tbps | — | nem lehetséges |
| Hibrid (Ring-2.5-1T) | ~170 Gbps | <100 Gbps | ~1.8 Tbps |
Kulcs tanulságok¶
- Modell architektúra + rendszerterv együtt: Hibrid attention csökkenti KVCache-t, de a szelektív offloading + sávszélesség-tudatos ütemezés teszi praktikussá
- Nem minden kérés offloaded: Csak hosszú prefillek — rövidek helyben maradnak
- Commodity Ethernet elég: 13% kihasználtság realistic workload-oknál
- Független skálázás: Prefill és decode külön régiókban/cloud-okban
- Következő generációs hardver társ-tervezés: Rubin CPX prefill-hez, LPU decode-hoz
Idézet¶
"A KVCache-barát modell architektúrák szükségesek, de nem elegendőek a cross-datacenter heterogén servinghez. Ami praktikussá teszi a telepítést, a modell-oldali KVCache-csökkentés és a rendszer-oldali szelektív offloading, valamint sávszélesség-tudatos ütemezés kombinációja."
Kapcsolódó témák¶
- AI és automatizáció — AI infrastruktúra, ágens gazdaság
- LLM supply chain — chip ellátási lánc, inference hardver
Forrás¶
- Paper: Prefill-as-a-Service: KVCache of Next-Generation Models Could Go Cross-Datacenter
- Szerzők: Qin et al. (Moonshot AI, Tsinghua)
- arXiv: 2604.15039v1
- Dátum: 2026. április 22.
- Feldolgozva: 2026. április 22.