Klasifikace typů stran dokumentu
Loading...
Date
Authors
Šmida, Matěj
Advisor
Referee
Mark
B
Journal Title
Journal ISSN
Volume Title
Publisher
Vysoké učení technické v Brně. Fakulta informačních technologií
ORCID
Abstract
Tato diplomová práce se zabývá se zabývá problémem automatické klasifikace stran v dokumentech, což je jeden z klíčových bodů v oblasti analýzy a zpracování dokumentů, jako je extrakce informací nebo digitální archivace. Práce se zaměřuje na metody hlubokého učení a zejména na architektury založené na vizuálních transformerech, jako je Vision Transformer (ViT model). Speciální pozornost je věnována multimodálnímu přístupu, který kombinuje vizuální informace z obrazu a extrahovaná textová data dokumentu a modelu CLIP, který jsem upravil pro klasifikaci a experimentoval s ním.
This thesis deals with the problem of automatic classification of pages in documents, which is one of the key issues in document analysis and processing, such as information extraction or digital archiving. The thesis focuses on deep learning methods and in particular on architectures based on visual transformers, such as the Vision Transformer (ViT model). Special attention is paid to a multimodal approach that combines visual information from an image and extracted text data from a document, and to the CLIP model that I have adapted for classification and experimented with.
This thesis deals with the problem of automatic classification of pages in documents, which is one of the key issues in document analysis and processing, such as information extraction or digital archiving. The thesis focuses on deep learning methods and in particular on architectures based on visual transformers, such as the Vision Transformer (ViT model). Special attention is paid to a multimodal approach that combines visual information from an image and extracted text data from a document, and to the CLIP model that I have adapted for classification and experimented with.
Description
Keywords
klasifikace dokumentu , zpracování obrazu , analýza dokumentů , počítačové vidění , strojové učení , Vision Transformer (ViT) , CLIP (Contrastive Language–Image Pre-training) , multimodální učení , document classification , image processing , document analysis , computer vision , machine learning , Vision Transformer (ViT) , CLIP (Contrastive Language–Image Pre-training) , multimodal learning
Citation
ŠMIDA, M. Klasifikace typů stran dokumentu [online]. Brno: Vysoké učení technické v Brně. Fakulta informačních technologií. 2025.
Document type
Document version
Date of access to the full text
Language of document
cs
Study field
Informační technologie
Comittee
prof. Ing. Adam Herout, Ph.D. (předseda)
Ing. Vladimír Bartík, Ph.D. (člen)
Ing. Michal Hradiš, Ph.D. (člen)
Ing. Josef Strnadel, Ph.D. (člen)
doc. Mgr. Adam Rogalewicz, Ph.D. (člen)
Date of acceptance
2025-06-16
Defence
Student nejprve prezentoval výsledky, kterých dosáhl v rámci své práce. Komise se poté seznámila s hodnocením vedoucího a posudkem oponenta práce. Student následně odpověděl na otázky oponenta a na další otázky přítomných. Komise se na základě posudku oponenta, hodnocení vedoucího, přednesené prezentace a odpovědí studenta na položené otázky rozhodla práci hodnotit stupněm B.
Result of defence
práce byla úspěšně obhájena
