Automatické rozpoznávání tabulek pomocí neuronových sítí
but.committee | prof. Dr. Ing. Pavel Zemčík, dr. h. c. (předseda) doc. Ing. Martin Čadík, Ph.D. (místopředseda) Ing. Vítězslav Beran, Ph.D. (člen) Ing. Roman Juránek, Ph.D. (člen) Ing. Zbyněk Křivka, Ph.D. (člen) Ing. Tomáš Milet, Ph.D. (člen) | cs |
but.defence | Student nejprve prezentoval výsledky, kterých dosáhl v rámci své práce. Komise se poté seznámila s hodnocením vedoucího a posudkem oponenta práce. Student následně odpověděl na otázky oponenta a na další otázky přítomných. Komise se na základě posudku oponenta, hodnocení vedoucího, přednesené prezentace a odpovědí studenta na položené otázky rozhodla práci hodnotit stupněm A. Otázky u obhajoby: Jak byly trénovány CNN pro extrakci vizuálních příznaků pro buňky a hrany? Využíváte nějak informaci o klasifikaci buněk z trénovacích dat? Výstupy OCR využíváte jako vstup Vaší metody i pro tvorbu ground truth anotací. Jak kvalitní jsou výstupy OCR a jaký mají dopad na přesnost rozpoznání tabulek? Zvládá kupříkladu vertikální text? Jak si poradí s textem přetékajícím do sousedních buněk? Dle tabulky 6.2 se zdá, že detekce strukturovaných záhlaví je problematická a síť buňky záhlaví klasifikuje jako datové. Zvažoval jste řešení pro tento problém? Problematická je i detekce prázdných buňek. Jsou prázdné buňky významné pro další zpracování rozpoznaných tabulek? Jak by vypadaly výsledky Vaší metody, pokud byste prázdné buňky při výpočtu metrik vyloučil? | cs |
but.jazyk | angličtina (English) | |
but.program | Informační technologie a umělá inteligence | cs |
but.result | práce byla úspěšně obhájena | cs |
dc.contributor.advisor | Hradiš, Michal | en |
dc.contributor.author | Piwowarski, Lukáš | en |
dc.contributor.referee | Španěl, Michal | en |
dc.date.accessioned | 2022-06-24T06:55:47Z | |
dc.date.available | 2022-06-24T06:55:47Z | |
dc.date.created | 2022 | cs |
dc.description.abstract | Tato práce seznamuje čtenáře se současnými technikami rozpoznávání tabulek, které se používají především k získávání informací z ručně psaných nebo tištěných historických tabulek. Představujeme také metodu založenou na grafové neuronové síti, která je inspirována představenými přístupy. Metoda se skládá ze tří fází: fáze inicializace grafu, fáze klasifikace uzlů/hran a fáze transformace grafu na text. Ve fázi inicializace grafu používáme algoritmus viditelnosti uzlů a OCR k vytvoření počáteční grafové reprezentace vstupní tabulky. Ve fázi klasifikace uzlů a hran jsou uzly a hrany klasifikovány a ve fázi transformace grafu na text zarovnáváme uzly grafu do mřížky, která je pak použita k vytvoření konečné textové reprezentace tabulky. Náš implementovaný model byl schopen dosáhnout přesnosti 68 % u detekce horizontálních sousedů, přesnosti 71 % u detekce vertikálních sousedů a přesnosti 83 % u detekce buněk na datové sadě ABP. | en |
dc.description.abstract | This thesis introduces the reader to the current table recognition techniques mainly used to extract information from historical handwritten and printed tables. We also introduce a method based on graph neural network, which is inspired by the presented techniques. The method consists of three phases: graph initialization, node/edge classification and graph to text transformation phase. In the graph initialization phase, we use the node visibility algorithm and OCR to create an initial graph representation of the input table. In the node and edge classification phase, the nodes and edges are classified, and in the graph to text transformation phase, we fit the graph's nodes into a grid which is then used to produce the final text representation of the table. The implemented model achieved horizontal neighbours detection precision of 68 %, vertical neighbours detection precision of 71 % and cell detection precision of 85 % on the ABP dataset. | cs |
dc.description.mark | A | cs |
dc.identifier.citation | PIWOWARSKI, L. Automatické rozpoznávání tabulek pomocí neuronových sítí [online]. Brno: Vysoké učení technické v Brně. Fakulta informačních technologií. 2022. | cs |
dc.identifier.other | 145454 | cs |
dc.identifier.uri | http://hdl.handle.net/11012/207853 | |
dc.language.iso | en | cs |
dc.publisher | Vysoké učení technické v Brně. Fakulta informačních technologií | cs |
dc.rights | Standardní licenční smlouva - přístup k plnému textu bez omezení | cs |
dc.subject | rozpoznávání tabulek | en |
dc.subject | grafové neuronové sítě | en |
dc.subject | neuronová síť Transformer | en |
dc.subject | nalezení hran | en |
dc.subject | nalezení uzlů | en |
dc.subject | opticke rozpoznávání znaků | en |
dc.subject | inicializace grafu | en |
dc.subject | hodnocení rozpoznávání tabulek | en |
dc.subject | table recognition | cs |
dc.subject | graph neural network | cs |
dc.subject | transformer neural network | cs |
dc.subject | edge discover | cs |
dc.subject | node discovery | cs |
dc.subject | optical character recognition | cs |
dc.subject | table recognition datasets | cs |
dc.subject | graph initialization | cs |
dc.subject | table recognition evaluation | cs |
dc.title | Automatické rozpoznávání tabulek pomocí neuronových sítí | en |
dc.title.alternative | Neural Networks for Automatic Table Recognition | cs |
dc.type | Text | cs |
dc.type.driver | masterThesis | en |
dc.type.evskp | diplomová práce | cs |
dcterms.dateAccepted | 2022-06-20 | cs |
dcterms.modified | 2022-06-23-09:13:55 | cs |
eprints.affiliatedInstitution.faculty | Fakulta informačních technologií | cs |
sync.item.dbid | 145454 | en |
sync.item.dbtype | ZP | en |
sync.item.insts | 2022.06.24 08:55:47 | en |
sync.item.modts | 2022.06.24 08:14:56 | en |
thesis.discipline | Počítačové vidění | cs |
thesis.grantor | Vysoké učení technické v Brně. Fakulta informačních technologií. Ústav počítačové grafiky a multimédií | cs |
thesis.level | Inženýrský | cs |
thesis.name | Ing. | cs |
Files
Original bundle
1 - 4 of 4
Loading...
- Name:
- final-thesis.pdf
- Size:
- 15.59 MB
- Format:
- Adobe Portable Document Format
- Description:
- final-thesis.pdf
Loading...
- Name:
- Posudek-Vedouci prace-24864_v.pdf
- Size:
- 86.1 KB
- Format:
- Adobe Portable Document Format
- Description:
- Posudek-Vedouci prace-24864_v.pdf
Loading...
- Name:
- Posudek-Oponent prace-24864_o.pdf
- Size:
- 94.63 KB
- Format:
- Adobe Portable Document Format
- Description:
- Posudek-Oponent prace-24864_o.pdf
Loading...
- Name:
- review_145454.html
- Size:
- 1.46 KB
- Format:
- Hypertext Markup Language
- Description:
- review_145454.html