Predikce povahy spamových krátkých textů textovým klasifikátorem

but.committeedoc. Dr. Ing. Petr Hanáček (předseda) prof. Ing. Martin Drahanský, Ph.D. (místopředseda) doc. Ing. Vladimír Drábek, CSc. (člen) doc. Mgr. Lukáš Holík, Ph.D. (člen) Ing. Vladimír Veselý, Ph.D. (člen) doc. Ing. Václav Zeman, Ph.D. (člen)cs
but.defenceStudent nejprve prezentoval výsledky, kterých dosáhl v rámci své práce. Komise se poté seznámila s hodnocením vedoucího a posudkem oponenta práce. Student následně odpověděl na otázku oponenta a na další otázky přítomných. Komise se na základě posudku oponenta, hodnocení vedoucího, přednesené prezentace a odpovědí studenta na položené otázky rozhodla práci hodnotit stupněm " B ". Otázky u obhajoby: Při vyhodnocování škálovatelnosti aplikace (kapitola 7.9) uvádíte, že program zvládne natrénovat klasifikátor až podle 100.000 vzorků. V testovacích sadách však máte nejvýše 1.000 anotovaných vzorků. Kde se těch dalších 99.000 vzorků vzalo? A pokud jste je získal duplikací, neovlivní to věrohodnost výsledků?cs
but.jazykčeština (Czech)
but.programInformační technologiecs
but.resultpráce byla úspěšně obhájenacs
dc.contributor.advisorŠimková, Hanacs
dc.contributor.authorDrápela, Karelcs
dc.contributor.refereeKřena, Bohuslavcs
dc.date.created2018cs
dc.description.abstractPráce se zabývá kategorizací krátkých spamových textů v SMS zprávách. V první části práce jsou shrnuty aktuální přístupy k textové klasifikaci a následuje popis nejpoužívanějších klasifikátorů. V dalších kapitolách je rozebrána anotace testovacích dat, implementace programu a výsledky klasifikace. Program je schopen klasifikovat texty na základě definovaných kategorií a také odhadnout přesnost klasifikátoru na trénovací sadě. Pro dva navržené typy kategorií dosahuje klasifikátor přesnosti až 82% a 92%. Předzpracování i výběr příznaků měly na přesnost pozitivní vliv. Přesnost je dále možné zvýšit odstraněním části vzorků, které má klasifikátor největší problémy zařadit. Při 80% pokrytí je možné zvýšit přesnost o 8-10%.cs
dc.description.abstractThis thesis deals with categorization of short spam texts from SMS messages. First part summarizes current methods for text classification and~it's followed by description of several commonly used classifiers. In following chapters test data analysis, program implementation and results are described. The program is able to predict text categories based on predefined set of classes and also estimate classification accuracy on training data. For the two category types, that I designed, classifier reached accuracy of 82% and 92% . Both preprocessing and feature selection had a positive impact on resulting accuracy. It is possible to improve this accuracy further by removing portion of samples, which are difficult to classify. With 80\% recall it is possible to increase accuracy by 8-10%.en
dc.description.markBcs
dc.identifier.citationDRÁPELA, K. Predikce povahy spamových krátkých textů textovým klasifikátorem [online]. Brno: Vysoké učení technické v Brně. Fakulta informačních technologií. 2018.cs
dc.identifier.other114603cs
dc.identifier.urihttp://hdl.handle.net/11012/84988
dc.language.isocscs
dc.publisherVysoké učení technické v Brně. Fakulta informačních technologiícs
dc.rightsStandardní licenční smlouva - přístup k plnému textu bez omezenícs
dc.subjectstrojové učenícs
dc.subjecttextová klasifikacecs
dc.subjectspamcs
dc.subjectpředzpracovánícs
dc.subjectvýběr příznakůcs
dc.subjectmachine learningen
dc.subjecttext classificationen
dc.subjectspamen
dc.subjectpreprocessingen
dc.subjectfeature selectionen
dc.titlePredikce povahy spamových krátkých textů textovým klasifikátoremcs
dc.title.alternativeMachine Learning Text Classifier for Short Texts Category Predictionen
dc.typeTextcs
dc.type.drivermasterThesisen
dc.type.evskpdiplomová prácecs
dcterms.dateAccepted2018-06-21cs
dcterms.modified2020-05-10-16:13:11cs
eprints.affiliatedInstitution.facultyFakulta informačních technologiícs
sync.item.dbid114603en
sync.item.dbtypeZPen
sync.item.insts2025.03.26 15:27:54en
sync.item.modts2025.01.15 12:39:26en
thesis.disciplineBezpečnost informačních technologiícs
thesis.grantorVysoké učení technické v Brně. Fakulta informačních technologií. Ústav inteligentních systémůcs
thesis.levelInženýrskýcs
thesis.nameIng.cs
Files
Original bundle
Now showing 1 - 4 of 4
Loading...
Thumbnail Image
Name:
final-thesis.pdf
Size:
1.55 MB
Format:
Adobe Portable Document Format
Description:
final-thesis.pdf
Loading...
Thumbnail Image
Name:
Posudek-Vedouci prace-20199_v.pdf
Size:
86.3 KB
Format:
Adobe Portable Document Format
Description:
Posudek-Vedouci prace-20199_v.pdf
Loading...
Thumbnail Image
Name:
Posudek-Oponent prace-20199_o.pdf
Size:
87.27 KB
Format:
Adobe Portable Document Format
Description:
Posudek-Oponent prace-20199_o.pdf
Loading...
Thumbnail Image
Name:
review_114603.html
Size:
1.46 KB
Format:
Hypertext Markup Language
Description:
file review_114603.html
Collections