Original title:
Vytěžování textu z fotografií
Translated title:
Optical Character Recognition at Camera Captured Images
Authors:
Kindermann, Hubert ; Blažek, Jan (advisor) ; Kolomazník, Jan (referee) Document type: Master’s theses
Year:
2014
Language:
cze Abstract:
[cze][eng] Představujeme postup řešení jednotlivých kroků potřebných k binarizaci a segmentaci řádků textu obsažených ve fotografiích stránek tištěného textu. Uvádíme způsob normalizace neuniformního osvětlení fotografie. Navrhujeme algoritmus pro binarizaci vstupní bitmapy založený na dvou- dimenzionálním pravděpodobnostním modelu pixelu, který bere v úvahu i jeho okolí. Pokračujeme popisem robustního detektoru orientace řádků textu založeného na optimalizaci účelové funkce vycházející z prvních derivací obrazové funkce. Nakonec se zabýváme detekcí jednotlivých řádků textu a jejich následnou segmentací. Tvary výsledných řádků textu na závěr optimalizujeme pomocí grafového algoritmu. Powered by TCPDF (www.tcpdf.org)We present solution of steps necessary for binarization and text lines detection contained in printed documents digitized by the camera. We introduce a normalization of non-uniform illumination method for text photographs. We propose input bitmap binarization algorithm based on two-dimensional probability pixel model which also considers its surrounding. We continue with description of robust text lines orientation detector based on optimization of risk function using first order derivatives of image function. In the end we present text lines detection and segmentation algorithm. Final shape of segmented lines is optimized with usage of graph algorithm. Powered by TCPDF (www.tcpdf.org)
Keywords:
character recognition; normalization; OCR; photos; segmentation; fotky; normalizace; OCR; rozpoznání znaků; segmentace
Institution: Charles University Faculties (theses)
(web)
Document availability information: Available in the Charles University Digital Repository. Original record: http://hdl.handle.net/20.500.11956/65883