Original title:
Analýza rizik prompt injection útoků v aplikacích využívajících velké jazykové modely
Translated title:
Analysis of Prompt Injection Risks in LLM-Augmented Applications
Authors:
Grečnár, Kristián ; Reš, Jakub (referee) ; Firc, Anton (advisor) Document type: Bachelor's theses
Year:
2026
Language:
eng Publisher:
Vysoké učení technické v Brně. Fakulta informačních technologií Abstract:
[eng][cze]
Útoky typu prompt injection predstavujú rastúcu bezpečnostnú hrozbu pre aplikácie založené na veľkých jazykových modeloch (LLM). Napriek svojej jednoduchosti môžu tieto útoky výrazne ovplyvniť správanie modelu a potenciálne viesť k odhaleniu citlivých informácií alebo k neúmyselným akciám systému. Keďže sa LLM čoraz viac integrujú do reálnych systémov, pochopenie a zmierňovanie týchto rizík sa stáva nevyhnutným. Táto práca skúma povahu a dopad útokov typu prompt injection prostredníctvom teoretickej analýzy aj praktických experimentov. Na základe týchto poznatkov sa vykonáva séria kontrolovaných útokov na vlastnú aplikáciu založenú na LLM, aby sa vyhodnotila náchylnosť rôznych jazykových modelov. Výsledky ukazujú, že útoky typu prompt injection môžu byť veľmi účinné a že súčasné obranné mechanizmy nemusia poskytovať dostatočnú ochranu. Okrem toho boli pozorované rozdiely v odolnosti medzi jednotlivými modelmi. Zistenia poukazujú na potrebu zlepšenia bezpečnostných stratégií a prispievajú k hlbšiemu pochopeniu rizík spojených s prompt injection v moderných systémoch umelej inteligencie.
Prompt injection attacks represent a growing security threat to applications based on large language models (LLMs). Despite their simplicity, these attacks can significantly influence model behavior and potentially lead to the disclosure of sensitive information or unintended system actions. As LLMs are increasingly integrated into real-world systems, understanding and mitigating these risks becomes essential. This thesis examines the nature and impact of prompt injection attacks through both theoretical analysis and practical experimentation. Based on these insights, a series of controlled attacks is performed on a custom LLM-based application to evaluate the susceptibility of different language models. The results demonstrate that prompt injection attacks can be highly effective and that current defense mechanisms may not provide sufficient protection. Additionally, differences in robustness across models are observed. The findings highlight the need for improved security strategies and contribute to a deeper understanding of prompt injection risks in modern AI systems.
Keywords:
adversariálne vstupy; bezpečnostné zraniteľnosti; dual-LLM vzor; filtrovanie vstupu; filtrovanie výstupu; prompt injection; veľké jazykové modely; adversarial inputs; dual-LLM pattern; input filtering; large language models; output filtering; prompt injection; security vulnerabilities
Institution: Brno University of Technology
(web)
Document availability information: Fulltext is available in the Brno University of Technology Digital Library. Original record: http://hdl.handle.net/11012/258761