Predikce povahy spamových krátkých textů textovým klasifikátorem
but.committee | doc. Dr. Ing. Petr Hanáček (předseda) prof. Ing. Martin Drahanský, Ph.D. (místopředseda) doc. Ing. Vladimír Drábek, CSc. (člen) doc. Mgr. Lukáš Holík, Ph.D. (člen) Ing. Vladimír Veselý, Ph.D. (člen) doc. Ing. Václav Zeman, Ph.D. (člen) | cs |
but.defence | Student nejprve prezentoval výsledky, kterých dosáhl v rámci své práce. Komise se poté seznámila s hodnocením vedoucího a posudkem oponenta práce. Student následně odpověděl na otázku oponenta a na další otázky přítomných. Komise se na základě posudku oponenta, hodnocení vedoucího, přednesené prezentace a odpovědí studenta na položené otázky rozhodla práci hodnotit stupněm " B ". Otázky u obhajoby: Při vyhodnocování škálovatelnosti aplikace (kapitola 7.9) uvádíte, že program zvládne natrénovat klasifikátor až podle 100.000 vzorků. V testovacích sadách však máte nejvýše 1.000 anotovaných vzorků. Kde se těch dalších 99.000 vzorků vzalo? A pokud jste je získal duplikací, neovlivní to věrohodnost výsledků? | cs |
but.jazyk | čeština (Czech) | |
but.program | Informační technologie | cs |
but.result | práce byla úspěšně obhájena | cs |
dc.contributor.advisor | Šimková, Hana | cs |
dc.contributor.author | Drápela, Karel | cs |
dc.contributor.referee | Křena, Bohuslav | cs |
dc.date.created | 2018 | cs |
dc.description.abstract | Práce se zabývá kategorizací krátkých spamových textů v SMS zprávách. V první části práce jsou shrnuty aktuální přístupy k textové klasifikaci a následuje popis nejpoužívanějších klasifikátorů. V dalších kapitolách je rozebrána anotace testovacích dat, implementace programu a výsledky klasifikace. Program je schopen klasifikovat texty na základě definovaných kategorií a také odhadnout přesnost klasifikátoru na trénovací sadě. Pro dva navržené typy kategorií dosahuje klasifikátor přesnosti až 82% a 92%. Předzpracování i výběr příznaků měly na přesnost pozitivní vliv. Přesnost je dále možné zvýšit odstraněním části vzorků, které má klasifikátor největší problémy zařadit. Při 80% pokrytí je možné zvýšit přesnost o 8-10%. | cs |
dc.description.abstract | This thesis deals with categorization of short spam texts from SMS messages. First part summarizes current methods for text classification and~it's followed by description of several commonly used classifiers. In following chapters test data analysis, program implementation and results are described. The program is able to predict text categories based on predefined set of classes and also estimate classification accuracy on training data. For the two category types, that I designed, classifier reached accuracy of 82% and 92% . Both preprocessing and feature selection had a positive impact on resulting accuracy. It is possible to improve this accuracy further by removing portion of samples, which are difficult to classify. With 80\% recall it is possible to increase accuracy by 8-10%. | en |
dc.description.mark | B | cs |
dc.identifier.citation | DRÁPELA, K. Predikce povahy spamových krátkých textů textovým klasifikátorem [online]. Brno: Vysoké učení technické v Brně. Fakulta informačních technologií. 2018. | cs |
dc.identifier.other | 114603 | cs |
dc.identifier.uri | http://hdl.handle.net/11012/84988 | |
dc.language.iso | cs | cs |
dc.publisher | Vysoké učení technické v Brně. Fakulta informačních technologií | cs |
dc.rights | Standardní licenční smlouva - přístup k plnému textu bez omezení | cs |
dc.subject | strojové učení | cs |
dc.subject | textová klasifikace | cs |
dc.subject | spam | cs |
dc.subject | předzpracování | cs |
dc.subject | výběr příznaků | cs |
dc.subject | machine learning | en |
dc.subject | text classification | en |
dc.subject | spam | en |
dc.subject | preprocessing | en |
dc.subject | feature selection | en |
dc.title | Predikce povahy spamových krátkých textů textovým klasifikátorem | cs |
dc.title.alternative | Machine Learning Text Classifier for Short Texts Category Prediction | en |
dc.type | Text | cs |
dc.type.driver | masterThesis | en |
dc.type.evskp | diplomová práce | cs |
dcterms.dateAccepted | 2018-06-21 | cs |
dcterms.modified | 2020-05-10-16:13:11 | cs |
eprints.affiliatedInstitution.faculty | Fakulta informačních technologií | cs |
sync.item.dbid | 114603 | en |
sync.item.dbtype | ZP | en |
sync.item.insts | 2025.03.26 15:27:54 | en |
sync.item.modts | 2025.01.15 12:39:26 | en |
thesis.discipline | Bezpečnost informačních technologií | cs |
thesis.grantor | Vysoké učení technické v Brně. Fakulta informačních technologií. Ústav inteligentních systémů | cs |
thesis.level | Inženýrský | cs |
thesis.name | Ing. | cs |
Files
Original bundle
1 - 4 of 4
Loading...
- Name:
- final-thesis.pdf
- Size:
- 1.55 MB
- Format:
- Adobe Portable Document Format
- Description:
- final-thesis.pdf
Loading...
- Name:
- Posudek-Vedouci prace-20199_v.pdf
- Size:
- 86.3 KB
- Format:
- Adobe Portable Document Format
- Description:
- Posudek-Vedouci prace-20199_v.pdf
Loading...
- Name:
- Posudek-Oponent prace-20199_o.pdf
- Size:
- 87.27 KB
- Format:
- Adobe Portable Document Format
- Description:
- Posudek-Oponent prace-20199_o.pdf
Loading...
- Name:
- review_114603.html
- Size:
- 1.46 KB
- Format:
- Hypertext Markup Language
- Description:
- file review_114603.html