Kihagyás

Prefill-as-a-Service: Cross-Datacenter KVCache for Next-Gen LLMs

Szerzők: Ruoyu Qin, Weiran He, Yaoyu Wang, Zheming Li, Xinran Xu, Yongwei Wu, Weimin Zheng, Mingxing Zhang
Intézmény: Moonshot AI, Tsinghua Egyetem
Dátum: 2026. április 22.
arXiv: 2604.15039v1
Link: https://arxiv.org/abs/2604.15039v1


Összegzés

A Prefill-Decode (PD) disaggregáció az LLM serving standardja, de a KVCache átviteli sávszélesség korlátozza a telepítést egyetlen adatközpontra. A hibrid attention architektúrák jelentősen csökkentik a KVCache méretét, lehetővé téve a cross-datacenter átvitelt. A PrfaaS (Prefill-as-a-Service) architektúra szelektíven offload-olja a hosszú kontextusú prefilleket külön compute-dense cluster-ekbe, és a KVCache-t commodity Etherneten keresztül továbbítja a helyi decode cluster-eknek.


Probléma

KVCache szűk keresztmetszet

  • Dense attention modellek: KVCache lineárisan nő a szekvencia hosszával
  • MiniMax-M2.5, 32K token: ~60 Gbps példányonként → RDMA szükséges
  • Ez egyetlen adatközpontra korlátozza a PD telepítést

Hibrid attention architektúrák

  • Teljes attention rétegek keverése lineáris komplexitású rétegekkel
  • Példák: Kimi Linear (3:1), MiMo-V2-Flash (5:1), Ring-2.5-1T (7:1)
  • KVCache 4-13× kisebb → cross-datacenter átvitel lehetséges

PrfaaS architektúra

Komponensek

  1. PrfaaS cluster-ek — standalone compute-dense cluster hosszú prefillekhez
  2. Helyi PD cluster-ek — hagyományos PD serving rövid prefillekhez és decode-hoz
  3. Hálózat — intra-cluster RDMA + inter-cluster VPC/dedikált Ethernet
  4. Hibrid prefix cache pool — külön kezelt linear states és full-attention KVCache

Szelektív offloading

  • Hossz-alapú routing küszöb: csak l > t kerül PrfaaS-be
  • Rövid kérések maradnak helyi PD úton
  • Optimális küszöb: t = 19.4K token (~50% kérés offloaded)

Sávszélesség-tudatos ütemezés

  • Egress kihasználtság és sorhossz monitorozás
  • Dinamikus küszöb beállítás torlódáskor
  • Layer-wise prefill pipelining + multi-connection TCP

Eredmények (1T paraméterű hibrid modell)

Metrika PrfaaS-PD Homogén PD Naiv Heterogén
Áteresztőképesség 3.24 req/s 2.11 req/s 2.45 req/s
Relatív 1.54× 1.00× 1.16×
Mean TTFT 2.22 s 4.44 s 1.74 s
P90 TTFT 3.51 s 9.73 s 3.51 s
  • 54% magasabb áteresztőképesség homogén PD-hez képest
  • 32% magasabb naiv heterogén PD-hez képest
  • Cross-datacenter sávszélesség: csak ~13 Gbps (13% a 100 Gbps linkből)

Hardver implikációk

Fázis-specializált hardver

  • NVIDIA Rubin CPX: compute throughput prefill-hez
  • Groq LPU / Taalas HC1: extrém memória sávszélesség decode-hoz
  • Cross-datacenter KVCache = nincs szükség közös RDMA fabric-re
  • Független skálázás prefill és decode kapacitásra

Sávszélesség igények

Modell 32K token 128K token 10K GPU DC
Dense (MiniMax) 3.8 Tbps — nem lehetséges
Hibrid (Ring-2.5-1T) ~170 Gbps <100 Gbps ~1.8 Tbps

Kulcs tanulságok

  1. Modell architektúra + rendszerterv együtt: Hibrid attention csökkenti KVCache-t, de a szelektív offloading + sávszélesség-tudatos ütemezés teszi praktikussá
  2. Nem minden kérés offloaded: Csak hosszú prefillek — rövidek helyben maradnak
  3. Commodity Ethernet elég: 13% kihasználtság realistic workload-oknál
  4. Független skálázás: Prefill és decode külön régiókban/cloud-okban
  5. Következő generációs hardver társ-tervezés: Rubin CPX prefill-hez, LPU decode-hoz

Idézet

"A KVCache-barát modell architektúrák szükségesek, de nem elegendőek a cross-datacenter heterogén servinghez. Ami praktikussá teszi a telepítést, a modell-oldali KVCache-csökkentés és a rendszer-oldali szelektív offloading, valamint sávszélesség-tudatos ütemezés kombinációja."


Kapcsolódó témák


Forrás

  • Paper: Prefill-as-a-Service: KVCache of Next-Generation Models Could Go Cross-Datacenter
  • Szerzők: Qin et al. (Moonshot AI, Tsinghua)
  • arXiv: 2604.15039v1
  • Dátum: 2026. április 22.
  • Feldolgozva: 2026. április 22.
Vissza a tetejére