Název:
Automatizovaná rekonstrukce webových stránek
Překlad názvu:
Automatic Webpage Reconstruction
Autoři:
Serečun, Viliam ; Ryšavý, Ondřej (oponent) ; Veselý, Vladimír (vedoucí práce) Typ dokumentu: Diplomové práce
Rok:
2018
Jazyk:
cze
Nakladatel: Vysoké učení technické v Brně. Fakulta informačních technologií
Abstrakt: [cze][eng]
Mnoho právnych inštitúcií vyžaduje dôkazné bremeno týkajúce sa webového obsahu. Táto diplomová práca sa zaoberá problémom spojeným s automatizáciou webovej rekonštrukcie a webovou archiváciou. Hlavným cieľom je poskytnúť riešenie s s otvoreným zdrojovým kódom , ktoré uspokojí právne inštitúcie s ich požiadavkami. Táto práca predstavuje dva hlavné produkty. Prvý je rámcový program, ktorý je základným stavebným kameňom pre vývoj aplikácií na extrakciu a archiváciu webových stránok. Druhým produktom je prototyp webovej aplikácie. Tento prototyp ukazuje využitie rámcového programu pri riešení požiadavok týchto inštitúcií. Výstupom aplikácie je archív formátu MAFF, ktorý obsahuje zrekonštruovanú webovú stránku, snímku obrazovky webovej stránky a tabuľku meta-informácií. Táto tabuľka zobrazuje informácie o zhromaždených údajoch, informáciách o serveroch, ako sú napríklad IP adresy a porty zariadenia, na ktorom sa nachádzala pôvodná webová stránka, a časové razítko.
Many legal institutions require a burden of proof regarding web content. This thesis deals with a problem connected to web reconstruction and archiving. The primary goal is to provide an open source solution, which will satisfy legal institutions with their requirements. This work presents two main products. The first is a framework, which is a fundamental building block for developing web scraping and web archiving applications. The second product is a web application prototype. This prototype shows the framework utilization. The application output is MAFF archive file which comprises a reconstructed web page, web page screenshot, and meta information table. This table shows information about collected data, server information such as IP addresses and ports of a device where is the original web page located, and time stamp.
Klíčová slova:
Extrakcia webu; Lemmiwinks; Mozilla Archive Format; Multi-Funkcionálny nástroj na indexáciu a archiváciu webového obsahu; Webová archivácia; Webová indexácia; Lemmiwinks; Mozilla Archive Format; Multi-Functional Index Scraping Tool; Web archiving; Web indexing; Web scraping
Instituce: Vysoké učení technické v Brně
(web)
Informace o dostupnosti dokumentu:
Plný text je dostupný v Digitální knihovně VUT. Původní záznam: http://hdl.handle.net/11012/84986