TurboQuant: Extreme Compression for KV Cache and Vector Search¶
Szerzők: Amir Zandieh, Vahab Mirrokni (Google Research)
Intézmény: Google Research
Dátum: 2026. március 24.
Konferencia: ICLR 2026
Link: https://research.google/blog/turboquant-redefining-ai-efficiency-with-extreme-compression/
Paper: https://arxiv.org/abs/2504.19874
Összegzés¶
A TurboQuant egy új quantization algoritmus, amely 3 bites KV cache tömörítést ér el nulla pontosságveszteséggel, fine-tuning nélkül. Két komponensből áll: PolarQuant (random rotation + polár koordináták) és QJL (Johnson-Lindenstrauss Transform, 1 bit). 6×-os KV cache méretcsökkentés, 8×-os sebességnövekedés H100-on.
Probléma¶
KV cache szűk keresztmetszet¶
- A KV cache a nagy nyelvi modellek memória-igényes komponense
- Nagy kontextusoknál exponenciálisan nő a memóriaigény
- Vector search: milliárdnyi vektor tárolása és keresése memória- és számításigényes
Hagyományos vector quantization problémája¶
- A legtöbb módszer quantization konstansokat tárol teljes pontossággal
- Ez 1-2 extra bitet ad számonként → részben semmissé teszi a tömörítést
- Memory overhead a quantization overhead miatt
TurboQuant működése¶
Kétlépcsős megközelítés¶
1. lépés: PolarQuant — fő tömörítés - Random rotation: az adatvektorokat véletlenszerűen elforgatja - Ez egyszerűsíti az adat geometriáját - Polár koordinátákra váltás (Cartesian → Polar) * Sugár (radius): az adat erőssége * Szög (angle): az adat iránya/jelentése - A szögek mintázata ismert és koncentrált → nincs szükség drága normalizálásra - A legtöbb bit itt használódik fel (a vektor fő komponenseinek tárolására)
2. lépés: QJL — maradék hiba eliminálása - Johnson-Lindenstrauss Transform: magas dimenziós adatok leképezése alacsonyabb dimenzióra - Minden szám 1 bitre tömörítve (+1 vagy -1 sign bit) - Zéró memória overhead - Speciális estimator: nagy pontosságú query + alacsony pontosságú adat egyensúlya - Pontos attention score számítás
Eredmény¶
- A két lépés együtt: fő tömörítés + hibajavítás
- 3 bites KV cache quantization
- Nulla pontosságveszteség (fine-tuning nélkül)
Eredmények¶
KV cache tömörítés¶
- 6×-os méretcsökkentés a KV cache-ben
- 8×-os sebességnövekedés H100 GPU-n (4-bit TurboQuant vs 32-bit nem tömörített)
- Gyorsabb futásidő az eredeti modellekhez képest (Gemma, Mistral)
- Elhanyagolható futásidejű overhead
Long-context benchmark-ek¶
- LongBench, Needle in a Haystack, ZeroSCROLLS, RULER, L-Eval
- Llama-3.1-8B-Instruct modellen tesztelve
- Needle in a Haystack: tökéletes eredmények minden benchmarkon
- Különböző bit-szélességeken tesztelve (2-bit, 3-bit, 4-bit)
Vector search¶
- GloVe dataset (d=200)
- Összehasonlítva: PQ (Product Quantization) és RabbiQ
- TurboQuant jobb 1@k recall ratio — nagyobb codebookok és dataset-specifikus tuning nélkül
- Data-oblivious működés: nem igényli a teljes dataset ismeretét
Technikai részletek¶
PolarQuant algoritmus¶
- Páros koordináták csoportosítása a d-dimenziós vektorból
- Polár koordináta rendszerre képezés
- Sugarak páronkénti összegyűjtése rekurzív polár transzformációkhoz
- Ismétlés amíg egyetlen végleges sugár és szöggyűjtemény marad
QJL (Quantized Johnson-Lindenstrauss)¶
- JLT: magas dimenziós adatok leképezése alacsonyabb dimenzióra távolságok megőrzésével
- Eredmény: minden szám 1 bit (sign)
- Zéró memória overhead
- Stratégikus egyensúly: nagy pontosságú query + alacsony pontosságú adat
Alkalmazási területek¶
KV cache tömörítés (LLM-ek)¶
- Nagy kontextusú modellek (Gemini)
- Memória hatékonyabb inference
- Hosszabb kontextusok kezelése ugyanazon hardveren
Vector search¶
- Szemantikus keresés milliárdnyi vektor között
- Index építés gyorsítása
- Memória hatékonyabb tárolás és lekérdezés
- Google skáláján: keresés, ajánlórendszerek, AI termékek
Kapcsolódó témák¶
- AI és automatizáció — AI hatékonyság, inference optimalizálás
- LLM supply chain — KV cache technológiák, quantization
- DeepMind és AlphaFold — Google AI kutatások
Forrás¶
- Blog: Google Research Blog — TurboQuant
- Szerzők: Amir Zandieh, Vahab Mirrokni
- Konferencia: ICLR 2026
- Paper: https://arxiv.org/abs/2504.19874
- Dátum: 2026. március 24.
- Feldolgozva: 2026. április 22.