Original title:
Nová obranná metoda proti jailbreak útokům na velké jazykové modely
Translated title:
A Novel Defense Method against Jailbreak Attacks on Large Language Models
Authors:
Kaška, Petr ; Firc, Anton (referee) ; Reš, Jakub (advisor) Document type: Master’s theses
Year:
2026
Language:
eng Publisher:
Vysoké učení technické v Brně. Fakulta informačních technologií Abstract:
[eng][cze]
Velké jazykové modely se stále častěji nasazují v produkčních systémech, kde jsou vystaveny útokům typu "jailbreak", které způsobují, že modely ignorují své vlastní bezpečnostní mechanismy a reagují na požadavky, které by za normálních okolností odmítly. Stávající obrany na úrovni promptů buď blokují legitimní dotazy spolu s nepřátelskými, nebo se spoléhají na náhodné narušení bez jakékoli naučené transformace, což vede k nepředvídatelným výsledkům. Tato práce navrhuje AlcaTRAz, komponentu, která pomocí genetického programování vyvíjí deterministické pravidlo znakové perturbace a aplikuje jej na vstupní prompt před předáním modelu, čímž narušuje strukturu adversariálních promptů bez poškození legitimních dotazů. Pravidlo je optimalizováno na škodlivých promptech pomocí fitness funkce integrující LLM-as-judge a nasazeno jako krok předzpracování typu black-box, přenositelný napříč cílovými architekturami bez nutnosti přeučení jednotlivých modelů. Metoda je vyhodnocena na rozsáhlém benchmarku jailbreak útoků napříč open-source cílovými modely. AlcaTRAz podstatně snižuje škodlivou poslušnost při zachování užitečnosti u neškodných dotazů a překonává všechny referenční obrany. Výsledky zároveň ukazují, že zdrojový dataset škodlivých promptů předpovídá úspěšnost útoku lépe než konkrétní útočná technika, a že pravidlo natrénované na jediném cílovém modelu se úspěšně přenáší napříč architekturami s výrazně odlišnými tokenizery.
Large language models are increasingly being deployed in production systems, where they are vulnerable to "jailbreak" attacks that cause the models to ignore their own security mechanisms and respond to requests they would normally reject. Existing prompt-level defenses either block legitimate queries along with malicious ones or rely on random perturbations without any learned transformation, leading to unpredictable results. This work proposes AlcaTRAz, a component that uses genetic programming to develop a deterministic character perturbation rule and applies it to the input prompt before passing it to the model, thereby disrupting the structure of adversarial prompts without harming legitimate queries. The rule is optimized on malicious prompts using a fitness function that integrates LLM-as-judge and deployed as a black-box preprocessing step, transferable across target architectures without the need to retrain individual models. The method is evaluated on a large-scale benchmark of jailbreak attacks across open-source target models. AlcaTRAz significantly reduces malicious compliance while preserving usefulness for harmless queries and outperforms all baseline defenses. The results also show that the source dataset of malicious prompts predicts attack success better than a specific attack technique, and that a rule trained on a single target model successfully transfers across architectures with significantly different tokenizers.
Keywords:
adversariální prompty; bezpečnost umělé inteligence; genetické programování; jailbreak útoky; LLM jako hodnotitel; prompt-level obrana; velké jazykové modely; znaková perturbace; adversarial prompts; AI safety; character perturbation; genetic programming; jailbreak attacks; large language models; LLM-as-judge; prompt-level defense
Institution: Brno University of Technology
(web)
Document availability information: Fulltext is available in the Brno University of Technology Digital Library. Original record: http://hdl.handle.net/11012/260425