Original title:
Krádež modelů strojového učení pomocí dotazování
Translated title:
Stealing Machine Learning Models via Query Probing
Authors:
Zobal, Tadeáš ; Firc, Anton (referee) ; Šalko, Milan (advisor) Document type: Bachelor's theses
Year:
2026
Language:
eng Publisher:
Vysoké učení technické v Brně. Fakulta informačních technologií Abstract:
[eng][cze]
Tato práce se zabývá útoky zaměřenými na extrakci modelů v rámci služeb strojového učení (MLaaS), které jsou přístupné přes black-box prostředí. Teoretická část práce shrnuje taxonomie extrakce a poskytuje přehled praktických obranných metod, včetně monitorování dotazů. Praktická část se zaměřuje na reprodukci útoku zaměřeného na extrakci konvoluční neuronové sítě, inspirovaného studií Knockoff Nets. Implementovali jsme a vyhodnotili tři monitorovací metody: Perceptual Hashing, PRADA a pokročilou metodu ADD, založenou na analýze vektorů vlastností dotazů. Tyto metody byly integrovány s adaptivní obranou, která modifikuje výstupy pro útočníka pomocí dynamického Gaussovského šumu. Naše experimenty ukazují, že ačkoli extrakce modelů představuje i nadále hrozbu, navrhované monitorovací techniky dokážou v určitých podmínkách účinně identifikovat podezřelé chování a snížit přesnost a věrnost odcizeného modelu. Neexistuje však jedna jediná monitorovací metoda, která by byla univerzálně použitelná pro všechny scénáře útoku.
This thesis investigates model extraction attacks against Machine Learning as a Service (MLaaS) models accessible via black-box API. The theoretical part of the thesis summarizes extraction taxonomies and provides an overview of practical defense methods, including monitoring methods. The practical part focuses on reproducing a convolutional neural network extraction attack inspired by the Knockoff Nets study. We implemented and evaluated three monitoring methods: Perceptual Hashing, PRADA, and the advanced ADD method based on analyzing the feature vectors of queries. These methods were integrated with an adaptive defense that modifies the adversary's outputs using dynamic Gaussian noise. Our experiments demonstrate that while extraction remains a threat, the proposed monitoring techniques can effectively identify suspicious behavior and lower the accuracy and fidelity of the stolen model under specific conditions. Yet, there is no single monitoring method that generalizes to all attack scenarios.
Keywords:
Extrakce modelu; Krádež modelu; MLaaS; Pravděpodobnostní hodnoty; Strojové učení jako služba; Třídní štítky; Zjišťování pomocí dotazů; Class Labels; Confidence Values; Machine Learning as a Service; MLaaS; Model Extraction; Model Stealing; Query Probing
Institution: Brno University of Technology
(web)
Document availability information: Fulltext is available in the Brno University of Technology Digital Library. Original record: http://hdl.handle.net/11012/258880