Google Research je predstavio TurboQuant, algoritam za kompresiju LLM KV keš (attention) podataka koji se ne zahteva trening. Metoda kvantizuje KV keš na 3 bita bez gubitka tačnosti modela. U benchmarku na Nvidia H100 GPU, varijanta na 4 bita postigla je do osam puta veći učinak pri računanju attention logits u odnosu na nekomprimovane 32-bitne ključeve, uz smanjenje memorije KV keša najmanje šest puta.
TurboQuant uklanja prekovremeni trošak koji nastaje u tradicionalnim kvantizacionim pristupima zbog dodatnih bita za parametre kvantizacije. Postupak ima dve faze: PolarQuant transformiše vektore u polarne koordinate kako bi se izbegla skupa normalizacija, a zatim QJL sloj (Quantized Johnson-Lindenstrauss) koriguje zaostalu kvantizacionu grešku kroz projekciju u manji prostor i svodi vrednosti na jedan bit znaka. Testovi na LongBench i drugim long-context skupovima sa modelima Gemma i Mistral pokazali su očuvanje rezultata, uz dobru primenu i u vektorskoj pretrazi. Rad, koji su napisali Amir Zandieh i Vahab Mirrokni, biće prezentovan na ICLR 2026.
