LoRA fino ugađanje 7B modela na hrvatskim pravnim korpusima s jednom 4090
Fino ugađanje velikih jezičnih modela (LLM) na specijaliziranim domenama poput hrvatskog prava može značajno poboljšati njihovu točnost i relevantnost. Međutim, za mnoge entuzijaste i male tvrtke, resursi poput više GPU-a ili skupih cloud instanci često su nedostižni. Srećom, tehnike poput LoRA (Low-Rank Adaptation) omogućuju fino ugađanje modela od 7 milijardi parametara na jednom potrošačkom GPU-u poput NVIDIA RTX 4090 s 24 GB VRAM-a. Ovaj članak vodi vas kroz cijeli proces, od pripreme podataka do evaluacije, s naglaskom na praktične kompromise.
Priprema podataka za hrvatski pravni korpus
Prvi korak je prikupljanje i čišćenje pravnih tekstova na hrvatskom jeziku. Izvori uključuju zakone, sudske presude, pravne članke i ugovore. Ključno je ukloniti duplikate, normalizirati Unicode (posebice dijakritičke znakove poput č, ć, đ, š, ž) i segmentirati tekst u manje dijelove (npr. 512-1024 tokena). Preporučuje se korištenje alata poput Hugging Face Datasets za učitavanje i tokenizaciju. Za hrvatski jezik, tokenizer modela poput Llama 2 ili Mistral već podržava Unicode, ali provjerite da li su svi znakovi ispravno mapirani.
Konfiguracija treniranja s LoRA-om
LoRA smanjuje broj parametara koji se treniraju umetanjem niskorangiranih matrica u slojeve pozornosti. Za 7B model, tipična konfiguracija uključuje rank = 8, alpha = 16, i target_modules = ['q_proj', 'v_proj']. Ovo omogućuje treniranje s batch size = 1 i gradient accumulation steps = 4 na RTX 4090, koristeći 4-bit kvantizaciju (QLoRA) za dodatno smanjenje memorije. Optimizator AdamW s learning rate = 2e-4 i linear scheduler dobro funkcioniraju. Pazite na warmup steps (npr. 100) kako biste stabilizirali treniranje.
Stvarni kompromisi i optimizacija
Iako LoRA omogućuje treniranje na jednom GPU-u, postoje kompromisi. Prvo, kvaliteta podataka je ključna – loše očišćen korpus može dovesti do pogrešaka u pravnim terminima. Drugo, trajanje treniranja na 4090 može biti sporo (npr. 10-20 sati za 1 epoch na 10 GB teksta). Treće, evaluacija zahtijeva ručnu provjeru jer automatske metrike poput perplexity ne odražavaju uvijek stvarnu korisnost. Preporučuje se testiranje na stvarnim pravnim upitima i usporedba s osnovnim modelom.
Zaključak
Fino ugađanje 7B modela na hrvatskim pravnim korpusima s LoRA-om na jednoj RTX 4090 je izvedivo i pristupačno. Ključ uspjeha leži u pažljivoj pripremi podataka, optimiziranoj konfiguraciji i realnim očekivanjima. Iako postoje ograničenja u brzini i preciznosti, ova metoda omogućuje malim timovima da izgrade specijalizirane modele bez velikih ulaganja.
Zanima vas ovakva AI tehnologija?
RiNET gradi sovereign AI rjesenja za javni sektor i poduzeca - od civic intelligence do automatizacije nabave.
Kontaktirajte nas →
Komentari