Original title:
Zpracování scanovaných dokumentů
Translated title:
Post-processing of scanned documents
Authors:
Tichý, Jan ; Mareš, Martin (advisor) ; Böhm, Martin (referee) Document type: Bachelor's theses
Year:
2015
Language:
cze Abstract:
[cze][eng] Předmětem této práce je navrhnout zpracování skenovaných dokumentů obsahujících textové a netextové elementy. V této práci je tento problém analyzován a rozdělen na menší podproblémy, které jsou dále řešeny. Hlavní řešené problémy jsou předzpracování obrázku, při kterém se mají potlačit nedostatky skenování, například špatný kontrast či našikmo sejmutý obraz, dále je řešena segmentace dokumentu na znaky, linky a obrázky a závěrem komprese výstupu pomocí clusterování znaků. Dále je cílem této práce navržené řešení implementovat formou programu, který naskenovaný dokument zpracuje a vytvoří PDF dokument skládající se z nalezených komponent. Powered by TCPDF (www.tcpdf.org)The subject of this work is to propose a method for post-processing of scanned documents containing text and non-text elements. In this work, this problem is analyzed and divided into smaller sub- problems, which are solved. Main problems we propose solutions to are pre-processing of an input image to suppress scanning defects such as poor contrast or rotation of an input image, segmentation to characters, lines and images and finally compression of output document by clustering text elements. We will implement this proposed method as a program processing scanned images into PDF document. Powered by TCPDF (www.tcpdf.org)
Keywords:
clustering; image processing; image segmentation; post-processing; clusterování; post-processing; segmentace obrazu; zpracování obrazu
Institution: Charles University Faculties (theses)
(web)
Document availability information: Available in the Charles University Digital Repository. Original record: http://hdl.handle.net/20.500.11956/61914