Attention-Aware Routing: kad router prestane gledati samo token i počne slušati kontekst
Dvadeset i devet godina, koliko traje moj brak s mrežnom opremom, naučio me jedno: najgore stvari u tehnologiji ne događaju se kad nešto ne radi. Dogode se kad nešto radi — samo pogrešno, samouvjereno, i s puno marketinga. Router u Mixture-of-Experts modelu je točno takav tip. Radi. Samo gleda preusko.
Ako ne znate što je MoE, evo u jednoj rečenici iz kuhinje: umjesto da ogromni jezični model za svaki token uključi sve parametre koje ima — a ima ih milijarde — on ih dijeli na "stručnjake" i router odlučuje kojih pet-šest stručnjaka će se uključiti za svaki token. To je kao da u restoranu s pedeset kuhara svako jelo priprema samo trojica, a ostali čekaju. Ekonomija je očita. Ako imaš pedeset kuhara, a plaćaš ih sve, a radi trojica — jebeno je glupo. MoE to rješava. Ali ima cijenu.
Ta cijena se zove routing. Router gleda skriveno stanje tokena — hidden state — i na temelju toga odlučuje kome ide. I to je sve. Skriveno stanje, ništa više. Kao da konobara pitate koju će večeru gost naručiti, a pokažete mu samo boju gostove košulje. Ponekad pogodi. Ponekad dobijete rižoto s ananasom.
Papir koji se pojavio na arXivu — Attention-Aware Routing, AAR — predlaže nešto što zvuči trivijalno, a nije: daj routeru još jedan signal. Ne samo skriveno stanje tokena, nego i ono što model već zna o kontekstu — sažetak attention weightova iz kliznog prozora. Prijevod za ljude: router prestaje gledati samo token i počinje slušati razgovor oko tokena.
Zvuči očito. To je zato što i je očito. Ali očite stvari u strojnom učenju obično objasne tek nakon tri godine i petsto milijuna dolara potrošenih na pogrešan pristup. Tako to ide kod nas.
Da razjasnimo mehaniku, jer bez toga je sve ostalo prazno. Transformer ima attention — mehanizam kojim svaki token "gleda" ostale tokene i odlučuje koliko ga koji zanima. Ti attention weightovi su, u grubom smislu, mapa konteksta: što je trenutno važno, što nije, kamo misao ide. To je najbogatiji signal u cijelom modelu. I router ga — do sada — nije koristio. Uopće.
AAR uzima klizni prozor attention weightova, izvlači iz njega temporalne i spektralne značajke, i to ubacuje routeru kao dodatni ulaz. Temporalne značajke = kako se pažnja mijenja kroz vrijeme, od tokena do tokena. Spektralne = koje frekvencije pažnje dominiraju, u smislu Fourierove analize. Da, Fourier. U LLM routeru. Frekvencijski spektar pažnje.
Ovo nije samo tehnički trik. Ovo je priznanje da je router do sada bio slijep na jednu cijelu dimenziju — dimenziju konteksta kao procesa, a ne kao stanja. Hidden state je fotografija. Attention kroz vrijeme je film. Router je donosio odluke na temelju fotografije i pitao se zašto film izgleda čudno.
I onda se čudimo kad model halucinira. Ne čudimo se. Trebali smo znati.
Evo gdje postaje zanimljivo za one koji prate brojeve. MoE modeli su postali industrijska norma u posljednje dvije godine. Mixtral, DeepSeek, Qwen, sve što ima više od trideset milijardi parametara a mora stati na nekoliko GPU-a — MoE je odgovor. Jer kad treniraš model s trilijun parametara, a pri inferenceu aktiviraš samo deset posto, dobivaš nešto što se ponaša kao gigant a troši kao osrednji model. To je vrijedno milijarde.
Ali router je bio usko grlo. Ne ono dramatično, ne ono što se vidi u benchmarku — ono tiho, u pozadini, koje pojede deset posto performanse i nitko ne zna zašto. Klasična priča iz svake mrežne infrastrukture koju sam ikad postavljao: problem nije kapacitet. Problem je odluka. Router koji donosi loše odluke je skuplji od routera koji ne postoji.
AAR, prema apstraktu, ne dira bazni transformer. To je važno. Ne mijenja arhitekturu, ne mijenja trening paradigmu, ne zahtijeva novi hardver. Samo dodaje signal routeru. To je najbolja vrsta poboljšanja: ono koje ne zahtijeva da sve baciš i počneš ispočetka, nego da priznaš da si nešto propustio i dodaš to.
U industriji koja svakih šest mjeseci izmišlja novu arhitekturu i tvrdi da je prethodna bila "fundamentalno pogrešna", ovo je gotovo konzervativno. Ne slažem se često s akademskim papirologijom, ali kad netko kaže "ne dirajmo temelje, popravimo ono što smo zanemarili" — to je zrelost. Rijetka u techu. Rijetka bilo gdje.
Sad, cinični dio. Zašto ovo nije već napravljeno?
Zato što je MoE postao popularan kroz scaling — kroz sirovu snagu. Kad imaš deset tisuća GPU-a i trilijun tokena, ne stigneš razmišljati o finesama routera. Stigneš ga uključiti i nadati se. A kad nešto radi dovoljno dobro, pitanje "zašto radi i bi li moglo bolje" postaje luksuz koji si ne možeš priuštiti jer konkurencija već trenira sljedeći model.
To je strukturna bolest cijele AI industrije: brzina je zamijenila razumijevanje. Svi trče, nitko ne gleda gdje gazi. I onda kad neki akademski papir pokaže da si cijelo vrijeme mogao dodati jedan signal i dobiti bolji model — svi se prave iznenađeni. Nisu iznenađeni. Znaju da nisu stigli pogledati.
Podsjeća me na devedesete, kad smo u Kvarner Netu postavljali prve usmjerivače. Cisco je tada bio bog i batina, a svaka konfiguracija je bila mala religija. Sjećam se da smo tjednima vrtili routing tablice, optimizirali metrike, i onda otkrili da je pola prometa išlo krivim putem jer nitko nije provjerio kako se OSPF ponaša kad link flapa. Nije to bila greška opreme. Bila je greška pretpostavke.
Router u MoE-u je ista priča. Pretpostavka da je token dovoljan kontekst za odluku. Nije. Nikad nije bila. Samo nitko nije stigao pogledati.
Ako AAR zaživi — a po svemu sudeći hoće, jer je elegantan i ne zahtijeva žrtve — posljedice idu dalje od akademskog citata. MoE modeli će postati efikasniji. To znači da će isti hardver davati više. To znači da će cijena inferencea pasti. To znači da će manje firme moći trenirati konkurentne modele. To znači da će oligopol velikih igrača — koji se trenutno drži na kapitalnim troškovima od milijardi dolara — dobiti još jedan udarac.
Naravno, veliki igrači će odmah usvojiti AAR i zadržati prednost, jer imaju podatke i računalne resurse da to skaliraju. Ali svaki napredak u efikasnosti smanjuje barijeru. Polako, mukotrpno, ali smanjuje. To je jedina dinamika koja u ovoj industriji ide u korist malih.
Ne treba se zavaravati da će AAR srušiti OpenAI ili Google. Neće. Ali svaki ovakav papir je još jedan čavao u lijes ideje da je AI igra samo za one s milijardama. Efikasnost je demokratizacija. Uvijek bila. Od prvih kompajlera do Linuxa do KV cachea do routinga koji gleda kontekst, a ne samo token.
Pitanje koje bi svatko u ovoj branši trebao postaviti glasi: ako router može biti pametniji tako da mu daš ono što model već zna — zašto mu to nismo dali prije pet godina? Odgovor je neugodan. Nismo stigli. Bili smo zauzeti skaliranjem. I sad nam jedan akademski papir pokazuje da smo propustili očito.
To nije sramota. Sramota je ne priznati to i nastaviti isto.
Izvor: arxiv.org
Zanima vas ovakva AI tehnologija?
RiNET gradi sovereign AI rjesenja za javni sektor i poduzeca - od civic intelligence do automatizacije nabave.
Kontaktirajte nas →
Komentari