Razvoj modela za detekciju ubrizgavanja upita u jezičkim modelima

  • Dušica Golubović Факултет организационих наука
Кључне речи: убризгавање упита, пробијање ограничења, језички модели, трансформер архитектура, BERT модел, фино подешавање, безбедност вештачке интелигенције

Сажетак

Ubrizgavanje upita (eng. prompt injection) predstavlja jedan od najznačajnijih bezbednosnih izazova u savremenim sistemima zasnovanim na velikim jezičkim modelima, jer omogućava zlonamernim korisnicima da zaobiđu ograničenja i izmene ponašanje modela. Ovaj rad ispituje mogućnost primene prethodno treniranih jezičkih modela zasnovanih na BERT arhitekturi u zadatku detekcije ubrizgavanja upita nakon procesa finog podešavanja.Eksperimentalni deo rada obuhvata doobuku i evaluaciju više BERT-baziranih modela na tri različita skupa podataka: javnom skupu preuzetom sa platforme Kaggle, nezavisnom test skupu sa platforme Hugging Face, kao i ručno konstruisanom skupu upita na srpskom jeziku. Performanse modela procenjene su primenom standardnih metrika binarne klasifikacije, sa posebnim osvrtom na odziv i F1 meru zbog nebalansirane raspodele klasa i bezbednosne prirode zadatka.Rezultati ukazuju na ograničenu sposobnost generalizacije modela na nezavisnom Hugging Face skupu podataka, dok su značajno bolji rezultati ostvareni na srpskom skupu, što potvrđuje sposobnost modela da se uspešno prilagode jezički specifičnom kontekstu. MiniLM-L6 model pokazao je najpovoljniji odnos preciznosti i odziva, dok je dodatna optimizacija hiper-parametara donela samo ograničena poboljšanja.

Објављено
2026-08-09
Секција
Информационо инжењерство