Kihagyás

TurboQuant: Extreme Compression for KV Cache and Vector Search

Szerzők: Amir Zandieh, Vahab Mirrokni (Google Research)
Intézmény: Google Research
Dátum: 2026. március 24.
Konferencia: ICLR 2026
Link: https://research.google/blog/turboquant-redefining-ai-efficiency-with-extreme-compression/
Paper: https://arxiv.org/abs/2504.19874


Összegzés

A TurboQuant egy új quantization algoritmus, amely 3 bites KV cache tömörítést ér el nulla pontosságveszteséggel, fine-tuning nélkül. Két komponensből áll: PolarQuant (random rotation + polár koordináták) és QJL (Johnson-Lindenstrauss Transform, 1 bit). 6×-os KV cache méretcsökkentés, 8×-os sebességnövekedés H100-on.


Probléma

KV cache szűk keresztmetszet

  • A KV cache a nagy nyelvi modellek memória-igényes komponense
  • Nagy kontextusoknál exponenciálisan nő a memóriaigény
  • Vector search: milliárdnyi vektor tárolása és keresése memória- és számításigényes

Hagyományos vector quantization problémája

  • A legtöbb módszer quantization konstansokat tárol teljes pontossággal
  • Ez 1-2 extra bitet ad számonként → részben semmissé teszi a tömörítést
  • Memory overhead a quantization overhead miatt

TurboQuant működése

Kétlépcsős megközelítés

1. lépés: PolarQuant — fő tömörítés - Random rotation: az adatvektorokat véletlenszerűen elforgatja - Ez egyszerűsíti az adat geometriáját - Polár koordinátákra váltás (Cartesian → Polar) * Sugár (radius): az adat erőssége * Szög (angle): az adat iránya/jelentése - A szögek mintázata ismert és koncentrált → nincs szükség drága normalizálásra - A legtöbb bit itt használódik fel (a vektor fő komponenseinek tárolására)

2. lépés: QJL — maradék hiba eliminálása - Johnson-Lindenstrauss Transform: magas dimenziós adatok leképezése alacsonyabb dimenzióra - Minden szám 1 bitre tömörítve (+1 vagy -1 sign bit) - Zéró memória overhead - Speciális estimator: nagy pontosságú query + alacsony pontosságú adat egyensúlya - Pontos attention score számítás

Eredmény

  • A két lépés együtt: fő tömörítés + hibajavítás
  • 3 bites KV cache quantization
  • Nulla pontosságveszteség (fine-tuning nélkül)

Eredmények

KV cache tömörítés

  • 6×-os méretcsökkentés a KV cache-ben
  • 8×-os sebességnövekedés H100 GPU-n (4-bit TurboQuant vs 32-bit nem tömörített)
  • Gyorsabb futásidő az eredeti modellekhez képest (Gemma, Mistral)
  • Elhanyagolható futásidejű overhead

Long-context benchmark-ek

  • LongBench, Needle in a Haystack, ZeroSCROLLS, RULER, L-Eval
  • Llama-3.1-8B-Instruct modellen tesztelve
  • Needle in a Haystack: tökéletes eredmények minden benchmarkon
  • Különböző bit-szélességeken tesztelve (2-bit, 3-bit, 4-bit)
  • GloVe dataset (d=200)
  • Összehasonlítva: PQ (Product Quantization) és RabbiQ
  • TurboQuant jobb 1@k recall ratio — nagyobb codebookok és dataset-specifikus tuning nélkül
  • Data-oblivious működés: nem igényli a teljes dataset ismeretét

Technikai részletek

PolarQuant algoritmus

  1. Páros koordináták csoportosítása a d-dimenziós vektorból
  2. Polár koordináta rendszerre képezés
  3. Sugarak páronkénti összegyűjtése rekurzív polár transzformációkhoz
  4. Ismétlés amíg egyetlen végleges sugár és szöggyűjtemény marad

QJL (Quantized Johnson-Lindenstrauss)

  • JLT: magas dimenziós adatok leképezése alacsonyabb dimenzióra távolságok megőrzésével
  • Eredmény: minden szám 1 bit (sign)
  • Zéró memória overhead
  • Stratégikus egyensúly: nagy pontosságú query + alacsony pontosságú adat

Alkalmazási területek

KV cache tömörítés (LLM-ek)

  • Nagy kontextusú modellek (Gemini)
  • Memória hatékonyabb inference
  • Hosszabb kontextusok kezelése ugyanazon hardveren

Vector search

  • Szemantikus keresés milliárdnyi vektor között
  • Index építés gyorsítása
  • Memória hatékonyabb tárolás és lekérdezés
  • Google skáláján: keresés, ajánlórendszerek, AI termékek

Kapcsolódó témák


Forrás

  • Blog: Google Research Blog — TurboQuant
  • Szerzők: Amir Zandieh, Vahab Mirrokni
  • Konferencia: ICLR 2026
  • Paper: https://arxiv.org/abs/2504.19874
  • Dátum: 2026. március 24.
  • Feldolgozva: 2026. április 22.
Vissza a tetejére