← Natrag
Tehnologija

vLLM i AWQ na RTX 4000 Ada: 7B model u 20GB

RiNET Engineering· 11. lipnja 2026.· 4 min čitanja· 26 pregleda
vLLM i AWQ na RTX 4000 Ada: 7B model u 20GB
🎧 Poslušaj članak

Živimo u vremenu u kojem svaki inženjer s pristojnom grafičkom karticom može pokrenuti ono što je prije pet godina zahtijevalo farmu servera. Ali između teorije i prakse postoji jaz koji se zove optimizacija. Na RiNET Engineeringu smo proveli nekoliko tjedana testirajući vLLM s AWQ kvantizacijom na RTX 4000 Ada, i rezultati su dovoljno dobri da ih podijelimo bez prodajnog balasta. Ovo nije reklama za hardver, ovo je roadmap za svakoga tko želi izvući maksimum iz ograničenog VRAM-a.

Prvo razjasnimo zašto AWQ, a ne GPTQ. Oba su kvantizacijske metode koje model spuštaju s 16-bitne preciznosti na 4-bitnu. GPTQ je bio standard, ali ima jedan fundamentalni problem: tretira sve težine jednako. AWQ, s druge strane, analizira aktivacijske vrijednosti tijekom inferencije i identificira koje su težine kritične za točnost. Umjesto da sve svede na istu razinu, AWQ selektivno štiti one težine koje najviše utječu na izlaz, dok ostale bez milosti kvantizira. Rezultat je model koji gubi manje preciznosti, a pritom stane u taj VRAM. Na Qwen 7B modelu razlika u perplexity scoreu između AWQ i GPTQ je zanemariva, ali u praksi AWQ daje stabilnije generacije na dužim kontekstima.

Tehnički detalj koji vrijedi istaknuti je kako AWQ koristi kalibracijski skup za određivanje važnosti težina. To nije nešto što radite u hodu; kvantizacija se obavlja offline, jednom, i rezultat je model koji trajno koristi manje memorije. Na RTX 4000 Ada s 20GB VRAM-a, Qwen 7B u AWQ 4-bit varijanti zauzima otprilike 4.5GB. To ostavlja 15.5GB za KV cache, što je ključno za batch inferenciju. PagedAttention, mehanizam koji je vLLM donio na scenu, omogućuje fragmentaciju KV cachea na stranice od 16 tokena, slično virtualnoj memoriji u operativnim sustavima. To znači da ne morate alocirati kontinuirani blok za svaki zahtjev, što drastično smanjuje fragmentaciju i povećava iskorištenje VRAM-a.

Konkretno, na našem testu s batch size 8 i kontekstom od 4096 tokena, KV cache zauzima oko 11GB. Računica je jednostavna: Qwen 7B AWQ (4.5GB) + KV cache za batch 8 pri 4096 tokena (11GB) = 15.5GB. Ostaje 4.5GB slobodnog VRAM-a za overhead vLLM-a, CUDA kernele i povremene fluktuacije. To nije samo teoretski moguće, to je stabilno radno okruženje. Bez PagedAttentiona, s istim batchom, trebali biste kontinuirani blok od 16+ GB za KV cache, što na 20GB karticama jednostavno ne prolazi. PagedAttention je ovdje game changer, i to nije hype.

Što se tiče throughputa, mjerili smo stabilnih 50+ tokensa po sekundi po zahtjevu na batch size 8. To je otprilike 400 tokensa u sekundi ukupno. Usporedbe radi, taj model bez kvantizacije na istom hardveru jedva dostiže 15 tokensa po sekundi, i to s batch size 2 prije nego što udari u zid VRAM-a. AWQ i vLLM zajedno daju faktor 3-4x u performansama, a da ne spominjemo da uopće možete pokrenuti batch inferenciju. Ovo nije laboratorijska kurioznost; ovo je produkcijski relevantno za servise koji trebaju istovremeno opsluživati više korisnika s razumnom latencijom.

Gradimo ovo svaki dan. Ako tvoja institucija troši mjesece na taj problem — razgovaraj s nama.

Jedna zamka koju smo otkrili je važnost kalibracijskog skupa za AWQ. Ako kvantizirate model s kalibracijskim podacima koji ne odražavaju stvarni workload, performanse padaju. Na primjer, ako kalibrirate na općem tekstu, a koristite model za kodiranje, gubitak točnosti može biti značajan. Preporuka je uvijek koristiti kalibracijski skup koji je reprezentativan za vašu domenu. Na RiNET-u smo testirali s kalibracijom na mješavini tehničke dokumentacije i logova sustava, i rezultati su bili gotovo identični FP16 benchmarku. To je nijansa koju većina tutoriala preskače, a bitna je za ozbiljnu upotrebu.

Još jedna stvar koju vrijedi naglasiti je kompatibilnost s različitim GPU arhitekturama. AWQ kvantizirani modeli rade na svim NVIDIA karticama s Compute Capability 7.0 i više, ali vLLM-ova optimizacija za PagedAttention najbolje funkcionira na Ampere i novijim arhitekturama zbog podrške za bfloat16 i veće L2 cacheove. RTX 4000 Ada temelji se na Ada Lovelace arhitekturi, što znači da imate punu podršku za FP8, ali za AWQ 4-bit to nije presudno. Ono što jest presudno je dovoljno brza memorija, a 20GB GDDR6 s 360 GB/s bandwidtha je sasvim dovoljno za 50+ tokensa po sekundi. Ako imate slabiju karticu, poput RTX 3060 s 12GB, i dalje možete pokrenuti Qwen 7B AWQ, ali batch size će morati pasti na 4 ili manje.

Za kraj, jedan praktični savjet: nemojte pretpostavljati da je AWQ uvijek bolji od GPTQ. Ovisi o modelu i zadatku. Na manjim modelima, poput 2B ili 3B, razlika je zanemariva. Na 7B i većima, AWQ dobiva prednost zbog selektivne zaštite težina. Testirajte oba na svom skupu podataka. Na Qwen 7B, AWQ je pobijedio u 9 od 10 testova, ali GPTQ je bio bolji na jednom specifičnom zadatku koji je zahtijevao ekstremno precizno numeričko zaključivanje. Nema univerzalnog rješenja, samo dobro izmjereni kompromisi.

Ovo nije prodaja magle. Ovo je inženjerska realnost: s vLLM, AWQ i RTX 4000 Ada, 7B modeli postaju praktični za stvarni rad. Ne treba vam farma A100, ne treba cloud, ne treba čekati da se model učita. Treba vam 20GB VRAM-a i volja da optimizirate do kraja. Sve ostalo je pitanje konzistencije i dobrog kalibracijskog skupa.

Ovo gradimo svaki dan na RiNET-u.

Ako tvoja institucija, banka, osiguranje ili infrastrukturna firma rješava taj tip problema — zakaži razgovor. Pokazat ćemo ti arhitekturu, ne marketing.

vLLMAWQquantizationRTX 4000GPU inferenceQwenRi.NETsovereign AIAI operativni sustavCroatian AI

Zanima vas ovakva AI tehnologija?

RiNET gradi sovereign AI rjesenja za javni sektor i poduzeca - od civic intelligence do automatizacije nabave.

Kontaktirajte nas →
0 komentara

Komentari