← Natrag
AI

Straničenje KV cachea na NVMe: Porez po tokenu

Damir Radulić· 14. rujna 2026.· 2 min čitanja· 4 pregleda
Straničenje KV cachea na NVMe: Porez po tokenu
🎧 Poslušaj članak

Kada kontekst premaši VRAM, straničenje KV cachea na NVMe dodaje mjerljiv porez na latenciju po tokenu. U ovom članku donosimo okvir za razmišljanje o tom trošku i strategije za njegovo ublažavanje.

Zašto je KV cache dragocjen resurs

KV cache (key-value cache) čuva međurezultate pažnje tijekom generiranja tokena. Njegova veličina raste linearno s brojem tokena u kontekstu i brojem slojeva modela. Za modele s dugim kontekstom (npr. 128K tokena), KV cache može zauzimati desetke gigabajta. Kada VRAM postane nedovoljan, sustav mora negdje smjestiti višak — najčešće na NVMe SSD.

Što je 'porez po tokenu'?

Svaki put kada model treba pristupiti dijelu KV cachea koji nije u VRAM-u, dolazi do čitanja s NVMe. To čitanje ima latenciju koja se dodaje vremenu generiranja svakog tokena. Taj dodatni trošak nazivamo 'porez po tokenu'. On nije fiksan; ovisi o:

  • Brzini NVMe uređaja (IOPS, propusnost)
  • Učestalosti pristupa udaljenim dijelovima cachea
  • Obrascu pristupa (sekvencijalni vs. nasumični)
  • Efikasnosti softverskog sloja za straničenje

Kvantificiranje poreza

Pretpostavimo da NVMe ima latenciju čitanja od 100 mikrosekundi i propusnost od 7 GB/s. Ako model mora dohvatiti 1 MB KV podataka po tokenu, to traje oko 0,14 ms. Za generiranje 1000 tokena, to je dodatnih 140 ms — primjetno kašnjenje. No, ako se pristupa samo malom dijelu cachea, porez može biti zanemariv.

Ključno je mjeriti stvarni uzorak pristupa. Alati poput vLLM ili TensorRT-LLM nude mehanizme za upravljanje KV cacheom, uključujući straničenje. Njihova implementacija može značajno smanjiti porez korištenjem prefetchinga i grupiranja zahtjeva.

Strategije za smanjenje poreza

  • Prefetching: unaprijed dohvatiti dijelove cachea koji će vjerojatno biti potrebni.
  • Kvantizacija KV cachea: smanjiti preciznost zapisa kako bi manje podataka išlo na NVMe.
  • Selektivno straničenje: držati najčešće korištene dijelove u VRAM-u.
  • Bolji hardver: NVMe s većim IOPS-om i nižom latencijom.

Zaključak

Straničenje KV cachea na NVMe nije besplatno, ali je često neizbježno za duge kontekste. Razumijevanje poreza po tokenu pomaže u donošenju odluka o hardveru i softveru. Uz pametne strategije, taj se porez može svesti na prihvatljivu razinu.

Zanima vas ovakva AI tehnologija?

RiNET gradi sovereign AI rjesenja za javni sektor i poduzeca - od civic intelligence do automatizacije nabave.

Kontaktirajte nas →
0 komentara

Komentari