3 Tačke
Članak

TurboQuant kompresuje LLM KV keš na 3 bita bez gubitka tačnosti

Google Research objavio TurboQuant, kompresionu metodu za LLM KV keš koja svodi podatke na 3 bita i smanjuje memorijske zahteve do 6x bez gubitka tačnosti.

3 Tačke
56 sekundi čitanja

Google Research je predstavio TurboQuant, algoritam za kompresiju LLM KV keš (attention) podataka koji se ne zahteva trening. Metoda kvantizuje KV keš na 3 bita bez gubitka tačnosti modela. U benchmarku na Nvidia H100 GPU, varijanta na 4 bita postigla je do osam puta veći učinak pri računanju attention logits u odnosu na nekomprimovane 32-bitne ključeve, uz smanjenje memorije KV keša najmanje šest puta.

TurboQuant uklanja prekovremeni trošak koji nastaje u tradicionalnim kvantizacionim pristupima zbog dodatnih bita za parametre kvantizacije. Postupak ima dve faze: PolarQuant transformiše vektore u polarne koordinate kako bi se izbegla skupa normalizacija, a zatim QJL sloj (Quantized Johnson-Lindenstrauss) koriguje zaostalu kvantizacionu grešku kroz projekciju u manji prostor i svodi vrednosti na jedan bit znaka. Testovi na LongBench i drugim long-context skupovima sa modelima Gemma i Mistral pokazali su očuvanje rezultata, uz dobru primenu i u vektorskoj pretrazi. Rad, koji su napisali Amir Zandieh i Vahab Mirrokni, biće prezentovan na ICLR 2026.

Povezani članci