Straničenje KV cachea na NVMe: Porez po tokenu
Kada kontekst premaši VRAM, straničenje KV cachea na NVMe dodaje mjerljiv porez na latenciju po tokenu. U ovom članku donosimo okvir za razmišljanje o tom trošku i strategije za njegovo ublažavanje.
Zašto je KV cache dragocjen resurs
KV cache (key-value cache) čuva međurezultate pažnje tijekom generiranja tokena. Njegova veličina raste linearno s brojem tokena u kontekstu i brojem slojeva modela. Za modele s dugim kontekstom (npr. 128K tokena), KV cache može zauzimati desetke gigabajta. Kada VRAM postane nedovoljan, sustav mora negdje smjestiti višak — najčešće na NVMe SSD.
Što je 'porez po tokenu'?
Svaki put kada model treba pristupiti dijelu KV cachea koji nije u VRAM-u, dolazi do čitanja s NVMe. To čitanje ima latenciju koja se dodaje vremenu generiranja svakog tokena. Taj dodatni trošak nazivamo 'porez po tokenu'. On nije fiksan; ovisi o:
- Brzini NVMe uređaja (IOPS, propusnost)
- Učestalosti pristupa udaljenim dijelovima cachea
- Obrascu pristupa (sekvencijalni vs. nasumični)
- Efikasnosti softverskog sloja za straničenje
Kvantificiranje poreza
Pretpostavimo da NVMe ima latenciju čitanja od 100 mikrosekundi i propusnost od 7 GB/s. Ako model mora dohvatiti 1 MB KV podataka po tokenu, to traje oko 0,14 ms. Za generiranje 1000 tokena, to je dodatnih 140 ms — primjetno kašnjenje. No, ako se pristupa samo malom dijelu cachea, porez može biti zanemariv.
Ključno je mjeriti stvarni uzorak pristupa. Alati poput vLLM ili TensorRT-LLM nude mehanizme za upravljanje KV cacheom, uključujući straničenje. Njihova implementacija može značajno smanjiti porez korištenjem prefetchinga i grupiranja zahtjeva.
Strategije za smanjenje poreza
- Prefetching: unaprijed dohvatiti dijelove cachea koji će vjerojatno biti potrebni.
- Kvantizacija KV cachea: smanjiti preciznost zapisa kako bi manje podataka išlo na NVMe.
- Selektivno straničenje: držati najčešće korištene dijelove u VRAM-u.
- Bolji hardver: NVMe s većim IOPS-om i nižom latencijom.
Zaključak
Straničenje KV cachea na NVMe nije besplatno, ali je često neizbježno za duge kontekste. Razumijevanje poreza po tokenu pomaže u donošenju odluka o hardveru i softveru. Uz pametne strategije, taj se porez može svesti na prihvatljivu razinu.
Zanima vas ovakva AI tehnologija?
RiNET gradi sovereign AI rjesenja za javni sektor i poduzeca - od civic intelligence do automatizacije nabave.
Kontaktirajte nas →
Komentari