Build vs Buy 2026: Kada graditi vlastiti LLM, a kada ne
Tijekom protekle dvije godine, tržište enterprise AI-ja prošlo je kroz tri faze: prvu, u kojoj su svi hitali prema OpenAI API-ju kao jedinom rješenju, drugu, u kojoj je svaki CTO sanjao o vlastitom GPU clusteru, i treću, u kojoj smo svi shvatili d...
7 od 10 webshopova koristi AI, ali to ne znači ništa
Na naslovnici ecommerce.hr nedavno je osvanula vijest koja zvuči kao prekretnica: AI je postao standard u hrvatskim webshopovima, koristi ga 7 od 10 trgovaca. Brojka je impresivna, posebno za zemlju u kojoj se još uvijek vode rasprave o tome treba...
Master supervisor: GPU mutex lock i 60s watchdog za 8 kritičnih servisa
Kad netko pomisli da je Kubernetes liveness probe dovoljna garancija za produkcijski rad na single GPU node-u, taj ili nije vidio što se događa kad CUDA context eksplodira u facu ili je prodavač cloud rješenja. Na jednom GPU-u, u jednom fizičkom t...
Telegram kao watchdog: zašto svaka kritična akcija mora poslati poruku
Monitoriranje infrastrukture je kao da čuvaš nuklearni reaktor s dva pijetla i jednim psom koji spava. Većina timova koristi Slack ili Discord za alerte — i to je u redu dok ne shvatiš da ti je aplikacija pala prije dvadeset minuta, a ti si tek sa...
Od RSS feeda do objave: 40 izvora, 30 sekundi, nula ljudskih ruku
Kad kažem da je ovaj članak generiran istim pipelineom koji opisujem, to nije marketinška fora. To je činjenica koju možete provjeriti na način na koji inženjeri provjeravaju stvari — analizom metapodataka, vremenskih oznaka i strukture. Pišem o v...
Schema migracije bez downtime-a: DDL u produkciji bez gašenja sustava
Kad god netko kaže da je dodavanje kolumne u PostgreSQL trivijalna operacija, vjerojatno nikad nije pokušao izvesti NOT NULL constraint na tablici od 50 milijuna redova dok aplikacija aktivno piše. U RiNET Engineeringu smo prošli kroz dovoljno tih...
PgBouncer na 6432 vs direct 5432: zašto transaction pooling pobjeđuje
Kad u produkciji imate tridesetak mikroservisa koji istovremeno pokušavaju doći do baze, klasični connection pool na aplikacijskoj strani postaje iluzija kontrole. Svaki servis otvara svoj set konekcija, svaki ima svoj pool, a baza vidi eksploziju...
AI Comment Replier: kada algoritam postane glas brenda
Svaki community manager koji je ikada morao odgovoriti na stotinu komentara ispod Facebook objave zna jednu stvar: ili ćeš odgovarati brzinom chat bota pa ćeš zvučati kao automat, ili ćeš pisati smislene odgovore i izgubiti dva sata dnevno. Treće ...
Zašto reranker pool sa 3 instance kao Postgres replicas
Reranker je u modernom RAG pipelineu onaj tihi ubojica performansi. Dok embedding modeli generiraju vektore koji su relativno jeftini za izračun, cross-encoder reranker mora proći kroz svaki par upita i dokumenta, izračunati similarity score i vra...
Inženjerska disciplina u AI eri: zašto je AI complete najopasnija fraza
Kada čujem pojam AI complete u kontekstu softverskog inženjerstva, ne pomišljam na napredak, već na sistemski rizik koji se maskira u inovaciju. U RiNET-u smo izabrali da tu frazu tretiramo kao alarm, ne kao oznaku zrelosti. Problem nije u samim m...
BEFORE INSERT triggeri: kako zaštititi DB od LLM halucinacija
U laboratorijskim uvjetima LLM modeli izgledaju savršeno. Daju koherentne odgovore, citiraju dokumente i rijetko priznaju neznanje. Ali kad ih spojiš na produkcijsku bazu podataka, dogodi se nešto što nijedan test set ne predviđa — model počinje g...
20TB cold archive: zašto institucionalna memorija ne smije ići u cloud
Prije nego što uopće krenemo pričati o backup strategiji, trebamo razjasniti jednu stvar koja se u industriji rutinski preskače. Podaci nisu jednaki. Institucije, pogotovo one koje rade s reguliranim ili infrastrukturnim sustavima, generiraju ogro...
Web builder za AI: kako jedan agent gradi cijelu platformu
Zamislimo scenarij koji zvuči kao science fiction, a zapravo je već danas operativna stvarnost u RiNET Engineeringu. Umjesto da developerski tim sjedi tjednima i piše boilerplate kod, dizajnira baze podataka i petlja s API endpointima, mi smo tog ...
Loki, Grafana i pgvector audit: tri sloja observabilityja za AI sustav
Kad gradite sustav koji samostalno donosi odluke u stvarnom vremenu, monitoring nije opcija – on je jedini način da uopće smijete pustiti taj sustav u produkciju. Većina inženjera misli da je observability samo pitanje dashboarda i alarma. To je k...
vLLM i AWQ na RTX 4000 Ada: 7B model u 20GB
Živimo u vremenu u kojem svaki inženjer s pristojnom grafičkom karticom može pokrenuti ono što je prije pet godina zahtijevalo farmu servera. Ali između teorije i prakse postoji jaz koji se zove optimizacija. Na RiNET Engineeringu smo proveli neko...
BGE-M3 embeddings: jedan model za stotinu jezika, retrieval i reranking
Kad smo prije dvije godine implementirali OpenAI-jev tekst-embedding-ada-002 model, činilo se to kao jedini ozbiljan izbor. Nije bilo alternative koja je pokrivala višejezičnost s dovoljnom preciznošću, a da pritom ne košta bogatstvo. U to vrijeme...
Autonomna digitalna institucija: kad AI postane operativni sustav, a ne aplikacija
Najopasnija pretpostavka u današnjoj digitalnoj transformaciji jest da uvođenje nekog AI alata čini organizaciju inteligentnom — dok zapravo samo prikriva odsutnost autonomne operativne jezgre. Gledali smo kako javni sektor i regulirane ind...