Original title:
Automatizovaná detekce ofenzivního jazyka a nenávistných projevů v přirozeném jazyce
Translated title:
Automated Detection of Hate Speech and Offensive Language
Authors:
Štajerová, Alžbeta ; Žmolíková, Kateřina (referee) ; Fajčík, Martin (advisor) Document type: Bachelor's theses
Year:
2019
Language:
cze Publisher:
Vysoké učení technické v Brně. Fakulta informačních technologií Abstract:
[cze][eng]
Táto práca sa zaoberá fenoménom nenávistných prejavov a ofenzívneho jazyka, ich definíciami a detekciou. Popisuje metódy doterajšieho riešenia detekcie. Zhodnocuje dostupné dátové sady využiteľné pri trénovaní modelov zameraných na detekciu tohto fenoménu. Dáva si za cieľ uviesť ďalšie metódy riešenia detekcie tohto problému a porovnanie ich výsledkov a vyhodnotenie úspešnosti. Zvolený problém bol riešený piatimi modelmi. Dva z nich boli zamerané na extrakciu príznakov a ich následnú klasifikáciu. Ďalšie tri boli riešené pomocou neurónových sietí. Úspešnosť implementovaných modelov som experimentálne vyhodnotila. Výsledky tejto práce umožňujú porovnanie typických prístupov s metódami využívajúcimi najnovšie poznatky z oblasti strojového učenia použitých pre klasifikáciu nenávistného a ofenzívneho jazyka.
This thesis discusses hate speech and offensive language phenomenon, their respective definitions and their occurrence in natural language. It describes previously used methods of solving the detection. An evaluation of available data sets suitable for the problem of detection is provided. The thesis aims to provide additional methods of solving the detection of this issue and it compares the results of these methods. Five models were selected in total. Two of them are focused on feature extraction and the remaining three are neural network models. I have experimentally evaluated the success of the implemented models. The results of this thesis allow for comparison of the typical approaches with the methods leveraging the newest findings in terms of machine learning that are used for the classification of hate speech and offensive language.
Keywords:
classification; detection; hate speech; machine learning; natural language processing; offensive language; text processing; detekcia; klasifikácia; nenávistný prejav; ofenzívny jazyk; spracovanie prirodzeného jazyka; spracovanie textu; strojové učenie
Institution: Brno University of Technology
(web)
Document availability information: Fulltext is available in the Brno University of Technology Digital Library. Original record: http://hdl.handle.net/11012/180134