# TurboQuant: Extreme Compression for KV Cache and Vector Search

**Szerzők:** Amir Zandieh, Vahab Mirrokni (Google Research)  
**Intézmény:** Google Research  
**Dátum:** 2026. március 24.  
**Konferencia:** ICLR 2026  
**Link:** https://research.google/blog/turboquant-redefining-ai-efficiency-with-extreme-compression/  
**Paper:** https://arxiv.org/abs/2504.19874

---

## Összegzés
A TurboQuant egy új quantization algoritmus, amely 3 bites KV cache tömörítést ér el nulla pontosságveszteséggel, fine-tuning nélkül. Két komponensből áll: PolarQuant (random rotation + polár koordináták) és QJL (Johnson-Lindenstrauss Transform, 1 bit). 6×-os KV cache méretcsökkentés, 8×-os sebességnövekedés H100-on.

---

## Probléma

### KV cache szűk keresztmetszet
- A KV cache a nagy nyelvi modellek memória-igényes komponense
- Nagy kontextusoknál exponenciálisan nő a memóriaigény
- Vector search: milliárdnyi vektor tárolása és keresése memória- és számításigényes

### Hagyományos vector quantization problémája
- A legtöbb módszer quantization konstansokat tárol teljes pontossággal
- Ez 1-2 extra bitet ad számonként → részben semmissé teszi a tömörítést
- Memory overhead a quantization overhead miatt

---

## TurboQuant működése

### Kétlépcsős megközelítés

**1. lépés: PolarQuant — fő tömörítés**
- Random rotation: az adatvektorokat véletlenszerűen elforgatja
- Ez egyszerűsíti az adat geometriáját
- Polár koordinátákra váltás (Cartesian → Polar)
  * Sugár (radius): az adat erőssége
  * Szög (angle): az adat iránya/jelentése
- A szögek mintázata ismert és koncentrált → nincs szükség drága normalizálásra
- A legtöbb bit itt használódik fel (a vektor fő komponenseinek tárolására)

**2. lépés: QJL — maradék hiba eliminálása**
- Johnson-Lindenstrauss Transform: magas dimenziós adatok leképezése alacsonyabb dimenzióra
- Minden szám 1 bitre tömörítve (+1 vagy -1 sign bit)
- Zéró memória overhead
- Speciális estimator: nagy pontosságú query + alacsony pontosságú adat egyensúlya
- Pontos attention score számítás

### Eredmény
- A két lépés együtt: fő tömörítés + hibajavítás
- 3 bites KV cache quantization
- Nulla pontosságveszteség (fine-tuning nélkül)

---

## Eredmények

### KV cache tömörítés
- **6×-os méretcsökkentés** a KV cache-ben
- **8×-os sebességnövekedés** H100 GPU-n (4-bit TurboQuant vs 32-bit nem tömörített)
- Gyorsabb futásidő az eredeti modellekhez képest (Gemma, Mistral)
- Elhanyagolható futásidejű overhead

### Long-context benchmark-ek
- LongBench, Needle in a Haystack, ZeroSCROLLS, RULER, L-Eval
- Llama-3.1-8B-Instruct modellen tesztelve
- **Needle in a Haystack:** tökéletes eredmények minden benchmarkon
- Különböző bit-szélességeken tesztelve (2-bit, 3-bit, 4-bit)

### Vector search
- GloVe dataset (d=200)
- Összehasonlítva: PQ (Product Quantization) és RabbiQ
- **TurboQuant jobb 1@k recall ratio** — nagyobb codebookok és dataset-specifikus tuning nélkül
- Data-oblivious működés: nem igényli a teljes dataset ismeretét

---

## Technikai részletek

### PolarQuant algoritmus
1. Páros koordináták csoportosítása a d-dimenziós vektorból
2. Polár koordináta rendszerre képezés
3. Sugarak páronkénti összegyűjtése rekurzív polár transzformációkhoz
4. Ismétlés amíg egyetlen végleges sugár és szöggyűjtemény marad

### QJL (Quantized Johnson-Lindenstrauss)
- JLT: magas dimenziós adatok leképezése alacsonyabb dimenzióra távolságok megőrzésével
- Eredmény: minden szám 1 bit (sign)
- Zéró memória overhead
- Stratégikus egyensúly: nagy pontosságú query + alacsony pontosságú adat

---

## Alkalmazási területek

### KV cache tömörítés (LLM-ek)
- Nagy kontextusú modellek (Gemini)
- Memória hatékonyabb inference
- Hosszabb kontextusok kezelése ugyanazon hardveren

### Vector search
- Szemantikus keresés milliárdnyi vektor között
- Index építés gyorsítása
- Memória hatékonyabb tárolás és lekérdezés
- Google skáláján: keresés, ajánlórendszerek, AI termékek

---

## Kapcsolódó témák

- [AI és automatizáció](../topics/ai-automation.md) — AI hatékonyság, inference optimalizálás
- [LLM supply chain](../topics/llm-supply-chain.md) — KV cache technológiák, quantization
- [DeepMind és AlphaFold](../topics/deepmind-alpha-fold.md) — Google AI kutatások

---

## Forrás

- **Blog:** Google Research Blog — TurboQuant
- **Szerzők:** Amir Zandieh, Vahab Mirrokni
- **Konferencia:** ICLR 2026
- **Paper:** https://arxiv.org/abs/2504.19874
- **Dátum:** 2026. március 24.
- **Feldolgozva:** 2026. április 22.