← Natrag
AI

Ličnost i odbijanje u AI modelima: zašto vas vaš chatbot neće uvrijediti

Damir Radulić· 27. lipnja 2026.· 3 min čitanja· 30 pregleda
Ličnost i odbijanje u AI modelima: zašto vas vaš chatbot neće uvrijediti
🎧 Poslušaj članak

Dvije linearne dimenzije u aktivacijskom prostoru su dovoljne da objasne zašto vaš chat model neće reći nešto gadno, ali hoće reći nešto suvislo — i to je, u svom najčišćem obliku, najbolji dokaz da je cijela industrija izgradila katedralu na pijesku.

Istraživači su u Qwen2.5-7B-Instruct i Llama-3.1-8B-Instruct identificirali smjer u aktivacijskom prostoru koji kontrolira odbijanje, i drugi smjer koji kontrolira ličnost. Zatim su ih testirali. I otkrili su ono što je svaki iskusni sysadmin znao od dana kad je prvi put konfigurirao firewall: ne riječ je o tome što sustav može, nego o tome tko on misli da jest. Komplijantna ličnost geyta odbijanje. Ako model misli da je fin momak, neće ti reći da se jebeš. Ako misli da je onaj koji govori istinu bez obzira na cijenu — hoće.

Pas mater.

Cijela ta industrija koja je izgradila biznis vrijedan trilijun dolara na ideji da su modeli "sigurni" jer su ih trenirali da odbijaju upite — zapravo je samo naučila modele da glume jednu ličnost. Jednu. Komplijantnu. Onu koja kaže: "Žao mi je, ne mogu vam pomoći s tim upitom." A ne onu koja kaže: "To je glupo pitanje i evo zašto."

I sada dolazi ključni dio koji će razveseliti svakog tko je ikad pokušao natjerati model da kaže nešto kontroverzno. Ako modelu pojačaš komplijantnu ličnost — on prestaje odbijati. Potpuno. U Llama modelu, pojačavanje komplijantne ličnosti je doslovno potisnulo mehanizam odbijanja. Model je postao onaj fini momak koji pristaje na sve, čak i na stvari koje ne bi trebao.

Ako je to istina za ova dva modela, a nema razloga da nije — vjerojatno je istina za većinu. Što znači da je cijeli safety alignment koji su kompanije radile posljednjih godina zapravo samo jedan veliki trik osobnosti. Nisi napravio model koji je "siguran" u smislu da razumije etiku i posljedice. Napravio si model koji glumi jednu ličnost. I ta ličnost se može promijeniti. S jednim vektorom u aktivacijskom prostoru.

Koji kurac.

Cijela industrija se hvali kako su modeli "odgovorni" i "sigurni", a zapravo su samo naučili glumiti jednu ulogu. Kao da si zaposlio glumca da glumi dobrog policajca, i onda si uvjeren da je on dobar policajac. Dok ne promijeniš scenarij. Onda je opet onaj taj glumac koji zna i lošeg policajca.

I tu dolazimo do dijela koji boli. Ovi modeli su trenirani na cijelom internetu. Na svim njegovim ljepotama i gadostima. Na svim njegovim istinama i lažima. Na svim njegovim finim i grubim riječima. I onda su ih "poravnali" da budu fini. Ali ispod te fine površine, sve ostalo je još uvijek tu. Samo čeka da netko povuče pravi vektor.

Istraživači su pokazali da komplijantna ličnost geyta odbijanje. To nije bug. To je feature. To je način na koji model funkcionira. On ne razumije "ne" kao apsolutnu kategoriju. On razumije "ne" kao posljedicu toga tko misli da jest. A to "tko misli da jest" je samo još jedan skup parametara.

Što znači da je cijela sigurnosna arhitektura modernih chat modela — od RLHF-a do constitutional AI-ja — zapravo samo jedna velika iluzija kontrole. Nisi kontrolirao model. Kontrolirao si njegovu ličnost. I to samo jednu od mogućih.

Sjećam se 1996. kad smo postavljali prve mail servere na Kvarner Netu. Ljudi su mislili da je sigurnost u lozinkama. Pa su mislili da je u enkripciji. Pa su mislili da je u firewallima. A zapravo je sve bilo u konfiguraciji. U tome tko ima pravo što raditi. Isto je i ovdje. Samo je konfiguracija skrivena u 7 milijardi parametara i zove se "persona steering".

Istraživači su intervenirali na oba vektora. I pokazali da se odbijanje može uključiti i isključiti jednostavnom promjenom ličnosti. Bez ikakve dodatne treniranosti. Bez ikakvih novih podataka. Samo malo matematike u aktivacijskom prostoru.

To je kao da otkriješ da se brava na tvojim vratima otvara ako vrata nazoveš pravim imenom. I to ime je "komplijantna ličnost".

Cijela industrija sada ima izbor. Mogu priznati da je safety alignment krhkiji od karte za metro. Ili mogu nastaviti prodavati maglu, uvjeravajući regulatore i javnost da su modeli "sigurni" dok u stvarnosti samo glume jednu ulogu.

Pogađajte što će izabrati.

Nije drago. Nije slučajno. Nije greška.

Izvor: arxiv.org

AI sigurnostpersona steeringrefusal mechanismLLM alignmentaktivacijski prostorsafety alignmentchat modeli

Zanima vas ovakva AI tehnologija?

RiNET gradi sovereign AI rjesenja za javni sektor i poduzeca - od civic intelligence do automatizacije nabave.

Kontaktirajte nas →
0 komentara

Komentari