Národní úložiště šedé literatury Nalezeno 27 záznamů.  začátekpředchozí17 - 26další  přejít na záznam: Hledání trvalo 0.00 vteřin. 
Comparison of approaches to text classification
Knížek, Jan ; Hana, Jiří (vedoucí práce) ; Vidová Hladká, Barbora (oponent)
The focus of this thesis is short text classification. Short text is the prevailing form of text on e-commerce and review platforms, such as Yelp, Tripadvisor or Heureka. As the popularity of the online communication is increasing, it is becoming infeasible for users to filter information manually. It is therefore becoming more and more important to recog- nise the relevant information in text. Classification of reviews is especially challenging, because they have limited structure, use informal language, contain a high number of errors and rely heavily on context and common knowledge. One of the possible appli- cations of machine learning is to automatically filter data and show users only relevant pieces of information. We work with restaurant reviews from Yelp and aim to predict their usefulness. Most restaurants have relatively many reviews, yet only few are truly useful. Our objective is to compare machine learning methods for predicting usefulness. 1
Klasifikace dokumentů pomocí umělé inteligence
Molnár, Ondřej ; Kačic, Matej (oponent) ; Třeštíková, Lenka (vedoucí práce)
Tato práce se zabývá klasifikací dokumentů za použití umělé inteligence. Popisuje principy klasifikace a strojového učení. Seznamuje s metodami UI a dále detailně představuje metodu klasifikace naivního Bayese. Poté líčí praktickou implementaci klasifikátoru do prostředí MS Office a diskutuje další možná rozšíření.
Programovací jazyk Scala a jeho využití pro analýzu dat
Kohout, Tomáš ; Bartík, Vladimír (oponent) ; Zendulka, Jaroslav (vedoucí práce)
Tato práce se zabývá porovnáním jazyka Scala s ostatními běžně používanými jazyky pro analýzu dat. Tyto jazyky se porovnávají z hlediska manipulace a zobrazení dat, strojvého učení a souběžného zpracování. Z tohoto porovnání následně vyplynou silné a slabé stránky jazyka Scala. Silné stránky jsou demonstrovány na implementované aplikaci pro kategorizaci e-mailů.
Rekurentní neuronové sítě pro klasifikaci textů
Myška, Vojtěch ; Kolařík, Martin (oponent) ; Povoda, Lukáš (vedoucí práce)
Diplomová práce se zabývá návrhem neuronových sítí pro klasifikaci pozitivních a negativních textů. Vývoj probíhal v programovacím jazyce Python. Návrh modelů hlubokých neuronových sítí byl proveden pomocí vysokoúrovňového API Keras využívající knihovnu pro numerické výpočty TensorFlow. Výpočetní operace byly provedeny pomocí GPU využívající CUDA architekturu. Výstupem práce je jazykově nezávislý model neuronových sítí umožňující klasifikaci textů na úrovni znaků. Vzorky byly úspěšně klasifikovány až v 93,64% případů. Trénovací a testovací data byla poskytnuta vícejazyčnou a Yelp databází. Simulace byly provedeny na 1200000 anglických, 12000 českých, německých a španělských textů.
Popularita osob automaticky
Hajič, Jan ; Bojar, Ondřej (vedoucí práce) ; Popel, Martin (oponent)
Možnost automaticky sledovat popularitu osob v~novinách by jistě uvítaly nejen tyto osoby samotné. Počítačové zpracovávání subjektivity je sice rychle se rozvíjející podobor komputační lingvistiky, v~češtině ovšem vůbec pro analýzu subjektivity a polarity v publicistice neexistují data. Začali jsme tedy s~tvorbou ručně anotovaného korpusu polarity z~českých publicistických textů, které se ovšem pro takové zpracování ukázaly jako krajně nevhodné. Dále jsme navrhli klasifikátor založený na statistických metodách, který by měl na základě tohoto korpusu popularitu sledovat, a otestovali jsme ho na korpusu recenzí bílého zboží a orientačně na zárodku našeho korpusu vět z~novinových článků. Jako model jsme použili automaticky extrahovaný unigramový slovník, tři příbuzné metody pro zjišťování polárních lemmat a množství filtrů pro selekci relevantních lemmat. Na recenzích bílého zboží jsme dosáhli výsledků srovnatelných se světovým výzkumem už se základním modelem, naopak u českých publicistických textů vidíme kvůli jejich charakteru možný příslib až u více lingvisticky orientovaných metod.
Feature selection for text classification with Naive Bayes
Lux, Erik ; Petříčková, Zuzana (vedoucí práce) ; Petříček, Martin (oponent)
Tato práce se zabývá výzkumem v oblasti klasifikace dokumentů. Popisuje již existujici techniky s důrazem na Naivní Bayesův klasifikátor. Zmíněny jsou i některé z metod pro výběr příznaků. Teoretické pozadí je základem pro implementaci klasifikační knihovny založené na metodě Naivního Bayesovského klasifikátoru. Knihovna poskytuje kromě samotného klasifikátoru i paletu nástrojů pro předzpracování textu. Tyto nástroje umožňují práci s rozličným typem dokumentů, ale především značně snižují nadbytečné dimenze vstupních dat. Knihovna je testována na dvou různych referenčních datových sadách na kterých jsou diskutovány rozdíly chování jednotlivých metod pro výběr příznaků. Funkčnost celé knihovny je prakticky ověřena jejím začleněním do open-source emailového klienta Mailpuccino.
Predikce vývoje ceny ropy na základě textových zpravodajských informací
Skalický, Jan ; Bojar, Ondřej (vedoucí práce) ; Žabokrtský, Zdeněk (oponent)
Pro předpověď vývoje ceny ropy existuje celá řada algoritmů. V této práci přinášíme nový pohled na tuto problematiku a představujeme náš projekt COPF. Pomocí klasifikátoru maximální entropie se snažíme předpovídat z textových informací dostupných na Internetu. Opíráme se o znalosti expertů v daném oboru. V rámci práce jsme testovali a vylepšovali úspěšnost systému COPF. Zjistili jsme, že tento přístup má mnoho problémů, které se ale dají řešit. V současném stavu naše úspěšnost sice překonala baseline, ovšem pro další vývoj je nutné získat více zdrojů dat. Naše metoda nebyla nikdy považována za nosnou, spíše může sloužit k vylepšení úspěšnosti předpovědí numerických algoritmů a v každém případě je zajímavá z hlediska možnosti dolování informací z textu.
Adaptivní RSS čtečka
Luža, Jindřich ; Otrusina, Lubomír (oponent) ; Smrž, Pavel (vedoucí práce)
Práce se zabývá možností obohacením běžné RSS čtečky o~rozšíření umožnující uživateli jednodušeji filtrovat RSS záznamy na základě jejich zařazení do skupin podle obsahu jejich textu. Jsou zde probrány problémy které vznikají při obecné klasifikaci a při klasifikaci textů. Dále je zde poukázáno na nutné teoretické aspekty formátu RSS, které je potřeba zvažovat při implementaci modulu RSS čtečky a možná podoba návrhnu modulu. Jako poslední je zde uvedeno testování vhodnosti použité klasifikátoru.
Inteligentní emailová schránka
Pohlídal, Antonín ; Drozd, Michal (oponent) ; Chmelař, Petr (vedoucí práce)
Tato diplomová práce se zabývá využitím klasifikace textu při třídění příchozí pošty. Nejdříve je popsána problematika získávání znalostí z databází a je detailně rozebrána klasifikace textu s popisem vybraných metod. Dále je uveden princip emailové komunikace a jsou popsány protokoly SMTP, POP3 a IMAP. Následuje návrh implementace systému, který klasifikuje příchozí poštu a rozbor použitých technologií, tedy Apache James Server, PostgreSQL a RapidMiner. Na závěr je uvedena implementace všech jednotlivých částí výsledného systému a jsou provedeny experimenty s testovací sadou emailů Enron Dataset.
Sledovač aktuálního dění
Odstrčilík, Martin ; Otrusina, Lubomír (oponent) ; Kouřil, Jan (vedoucí práce)
Cílem diplomové práce bylo vytvoření aplikace pro sledování aktuálního dění v okolí jejího uživatele. Tato aplikace by měla umožňovat jejím uživatelům události nejen sledovat, ale také přidávat své vlastní či komentovat již existující. Diplomová práce se mimo tvorbu dané aplikace zaobírá analýzou předloženého problému. Analýza zahrnuje průzkum existujících řešení, dostupných technologií a aplikačních rámců využitelných k implementaci. Součástí práce je i popis teorie klasifikace dat, která je v rámci vyvíjené aplikace použita k analýze událostí a komentářů. V textu práce je dále zahrnut návrh řešení, jenž se zaměřuje na návrh uživatelského rozhraní, architektury aplikace, databáze, komunikačního protokolu a klasifikátorů. Jádrem práce je pak popis implementace aplikace. V závěru práce je pak shrnut její průběh a jsou navrhována vhodná rozšíření do budoucna.

Národní úložiště šedé literatury : Nalezeno 27 záznamů.   začátekpředchozí17 - 26další  přejít na záznam:
Chcete být upozorněni, pokud se objeví nové záznamy odpovídající tomuto dotazu?
Přihlásit se k odběru RSS.