Název:
Rozpoznávání a propojování pojmenovaných entit
Překlad názvu:
Named Entity Recognition and Linking
Autoři:
Taufer, Pavel ; Straka, Milan (vedoucí práce) ; Kliegr, Tomáš (oponent) Typ dokumentu: Diplomové práce
Rok:
2017
Jazyk:
eng
Abstrakt: [eng][cze] The goal of this master thesis is to design and implement a named entity recognition and linking algorithm. A part of this goal is to propose and create a knowledge base that will be used in the algorithm. Because of the limited amount of data for languages other than English, we want to be able to train our method on one language, and then transfer the learned parameters to other languages (that do not have enough training data). The thesis consists of description of available knowledge bases, existing methods and design and implementation of our own knowledge base and entity linking method. Our method achieves state of the art result on a few variants of the AIDA CoNLL-YAGO dataset. The method also obtains comparable results on a sample of Czech annotated data from the PDT dataset using the parameters trained on the English CoNLL dataset. Powered by TCPDF (www.tcpdf.org)Cílem této diplomové práce je navrhnout a naimplementovat algoritmus pro rozpoznávání a propojování pojmenovaných entit. Součástí tohoto cíle je také navrhnutí a vytvoření báze znalostí, která je v algoritmu použita. Vzhledem k omezenému množství dat pro jiné jazyky než pro angličtinu chceme, aby naši metodu bylo možné natrénovat na jednom jazyku a naučené parametry přenést na jiné jazyky (ve kterých není tolik trénovacích dat). Práce se skládá z popisu dostupných bází znalostí, existujicích metod, navrhnutí a implementace vlastní báze znalostí a metody pro propojování pojmenovaných entit. Na několika variantách tradičního datasetu AIDA CoNLL-YAGO dosahuje implementovaný algoritmus nejlepších známých výsledků. Na vzorku českých anotovaných dat z datasetu PDT dosahuje algoritmus pomocí parametrů natrénovaných na anglickém CoNLL datasetu srovnatelných výsledků. Powered by TCPDF (www.tcpdf.org)
Klíčová slova:
pojmenované entity; propojování pojmenovaných entit; rozpoznávání pojmenovaných entit; named entities; named entity linking; named entity recognition