|
Shlukování textových dat
Leixner, Petr ; Burgetová, Ivana (oponent) ; Bartík, Vladimír (vedoucí práce)
Proces shlukování textových dat slouží pro analýzu, navigaci a strukturování velkých kolekcí textů nebo hypertextových dokumentů. Úkolem shlukování je rozklad množiny dokumentů do shluků na základě jejich podobnosti. Nejznámější metody z této oblasti dolování však neřeší specifické problémy textového shlukování, jako vysokou dimenzionalitu vstupních dat, velmi velkou velikost databází a srozumitelnost popisu shluků. Tato práce se zabývá uvedenou problematikou a popisuje moderní metodu shlukování textových dat založenou na použití frekventovaných množin termů, která se svým přístupem snaží řešit nedostatky jiných shlukovacích metod.
|
|
Metody extrakce informace z textových dokumentů
Sychra, Tomáš ; Burget, Radek (oponent) ; Bartík, Vladimír (vedoucí práce)
Získávání znalostí z textových dokumentů představuje podmnožinu obecného získávání dat - dataminingu. Textové dokumenty však mají vlastnosti odlišné od běžných databází. Tato práce obsahuje přehled metod použitelných pro dolování informací z textů. Nejpoužívanější dolovací úlohou je klasifikace. Popíši možné přístupy při klasifikování dokumentů. V závěru představím algoritmus Winnow, který by měl při klasifikaci dosahovat dobrých výsledků v porovnání s ostatními algoritmy. Součástí práce je i popis implementace algoritmu Winnow a přehled dosažených výsledků.
|
|
Shlukování textových dat
Leixner, Petr ; Burgetová, Ivana (oponent) ; Bartík, Vladimír (vedoucí práce)
Proces shlukování textových dat slouží pro analýzu, navigaci a strukturování velkých kolekcí textů nebo hypertextových dokumentů. Úkolem shlukování je rozklad množiny dokumentů do shluků na základě jejich podobnosti. Nejznámější metody z této oblasti dolování však neřeší specifické problémy textového shlukování, jako vysokou dimenzionalitu vstupních dat, velmi velkou velikost databází a srozumitelnost popisu shluků. Tato práce se zabývá uvedenou problematikou a popisuje moderní metodu shlukování textových dat založenou na použití frekventovaných množin termů, která se svým přístupem snaží řešit nedostatky jiných shlukovacích metod.
|
|
Metody extrakce informace z textových dokumentů
Sychra, Tomáš ; Burget, Radek (oponent) ; Bartík, Vladimír (vedoucí práce)
Získávání znalostí z textových dokumentů představuje podmnožinu obecného získávání dat - dataminingu. Textové dokumenty však mají vlastnosti odlišné od běžných databází. Tato práce obsahuje přehled metod použitelných pro dolování informací z textů. Nejpoužívanější dolovací úlohou je klasifikace. Popíši možné přístupy při klasifikování dokumentů. V závěru představím algoritmus Winnow, který by měl při klasifikaci dosahovat dobrých výsledků v porovnání s ostatními algoritmy. Součástí práce je i popis implementace algoritmu Winnow a přehled dosažených výsledků.
|