# Prefill-as-a-Service: Cross-Datacenter KVCache for Next-Gen LLMs

**Szerzők:** Ruoyu Qin, Weiran He, Yaoyu Wang, Zheming Li, Xinran Xu, Yongwei Wu, Weimin Zheng, Mingxing Zhang  
**Intézmény:** Moonshot AI, Tsinghua Egyetem  
**Dátum:** 2026. április 22.  
**arXiv:** 2604.15039v1  
**Link:** https://arxiv.org/abs/2604.15039v1

---

## Összegzés
A Prefill-Decode (PD) disaggregáció az LLM serving standardja, de a KVCache átviteli sávszélesség korlátozza a telepítést egyetlen adatközpontra. A hibrid attention architektúrák jelentősen csökkentik a KVCache méretét, lehetővé téve a cross-datacenter átvitelt. A PrfaaS (Prefill-as-a-Service) architektúra szelektíven offload-olja a hosszú kontextusú prefilleket külön compute-dense cluster-ekbe, és a KVCache-t commodity Etherneten keresztül továbbítja a helyi decode cluster-eknek.

---

## Probléma

### KVCache szűk keresztmetszet
- Dense attention modellek: KVCache lineárisan nő a szekvencia hosszával
- MiniMax-M2.5, 32K token: ~60 Gbps példányonként → RDMA szükséges
- Ez egyetlen adatközpontra korlátozza a PD telepítést

### Hibrid attention architektúrák
- Teljes attention rétegek keverése lineáris komplexitású rétegekkel
- Példák: Kimi Linear (3:1), MiMo-V2-Flash (5:1), Ring-2.5-1T (7:1)
- KVCache 4-13× kisebb → cross-datacenter átvitel lehetséges

---

## PrfaaS architektúra

### Komponensek
1. **PrfaaS cluster-ek** — standalone compute-dense cluster hosszú prefillekhez
2. **Helyi PD cluster-ek** — hagyományos PD serving rövid prefillekhez és decode-hoz
3. **Hálózat** — intra-cluster RDMA + inter-cluster VPC/dedikált Ethernet
4. **Hibrid prefix cache pool** — külön kezelt linear states és full-attention KVCache

### Szelektív offloading
- Hossz-alapú routing küszöb: csak l > t kerül PrfaaS-be
- Rövid kérések maradnak helyi PD úton
- Optimális küszöb: t = 19.4K token (~50% kérés offloaded)

### Sávszélesség-tudatos ütemezés
- Egress kihasználtság és sorhossz monitorozás
- Dinamikus küszöb beállítás torlódáskor
- Layer-wise prefill pipelining + multi-connection TCP

---

## Eredmények (1T paraméterű hibrid modell)

| Metrika | PrfaaS-PD | Homogén PD | Naiv Heterogén |
|---------|-----------|------------|----------------|
| Áteresztőképesség | 3.24 req/s | 2.11 req/s | 2.45 req/s |
| Relatív | 1.54× | 1.00× | 1.16× |
| Mean TTFT | 2.22 s | 4.44 s | 1.74 s |
| P90 TTFT | 3.51 s | 9.73 s | 3.51 s |

- **54% magasabb áteresztőképesség** homogén PD-hez képest
- **32% magasabb** naiv heterogén PD-hez képest
- **Cross-datacenter sávszélesség:** csak ~13 Gbps (13% a 100 Gbps linkből)

---

## Hardver implikációk

### Fázis-specializált hardver
- NVIDIA Rubin CPX: compute throughput prefill-hez
- Groq LPU / Taalas HC1: extrém memória sávszélesség decode-hoz
- Cross-datacenter KVCache = nincs szükség közös RDMA fabric-re
- Független skálázás prefill és decode kapacitásra

### Sávszélesség igények
| Modell | 32K token | 128K token | 10K GPU DC |
|--------|-----------|------------|------------|
| Dense (MiniMax) | 3.8 Tbps | — | nem lehetséges |
| Hibrid (Ring-2.5-1T) | ~170 Gbps | <100 Gbps | ~1.8 Tbps |

---

## Kulcs tanulságok

1. **Modell architektúra + rendszerterv együtt:** Hibrid attention csökkenti KVCache-t, de a szelektív offloading + sávszélesség-tudatos ütemezés teszi praktikussá
2. **Nem minden kérés offloaded:** Csak hosszú prefillek — rövidek helyben maradnak
3. **Commodity Ethernet elég:** 13% kihasználtság realistic workload-oknál
4. **Független skálázás:** Prefill és decode külön régiókban/cloud-okban
5. **Következő generációs hardver társ-tervezés:** Rubin CPX prefill-hez, LPU decode-hoz

---

## Idézet

> "A KVCache-barát modell architektúrák szükségesek, de nem elegendőek a cross-datacenter heterogén servinghez. Ami praktikussá teszi a telepítést, a modell-oldali KVCache-csökkentés és a rendszer-oldali szelektív offloading, valamint sávszélesség-tudatos ütemezés kombinációja."

---

## Kapcsolódó témák

- [AI és automatizáció](../topics/ai-automation.md) — AI infrastruktúra, ágens gazdaság
- [LLM supply chain](../topics/llm-supply-chain.md) — chip ellátási lánc, inference hardver

---

## Forrás

- **Paper:** Prefill-as-a-Service: KVCache of Next-Generation Models Could Go Cross-Datacenter
- **Szerzők:** Qin et al. (Moonshot AI, Tsinghua)
- **arXiv:** 2604.15039v1
- **Dátum:** 2026. április 22.
- **Feldolgozva:** 2026. április 22.