Speaker Recognition Based on Long Temporal Context

but.committeeprof. Dr. Ing. Jan Černocký (předseda) doc. Ing. Jaroslav Zendulka, CSc. (místopředseda) Ing. Zbyněk Křivka, Ph.D. (člen) doc. Ing. Richard Růžička, Ph.D., MBA (člen) doc. Ing. Jiří Rybička, Dr. (člen) prof. Dr. Ing. Pavel Zemčík, dr. h. c. (člen)cs
but.defenceStudent nejprve prezentoval výsledky, kterých dosáhl v rámci své práce. Komise se poté seznámila s hodnocením vedoucího a posudkem oponenta práce. Student následně odpověděl na otázky oponenta a na další otázky přítomných. Komise se na základě posudku oponenta, hodnocení vedoucího, přednesené prezentace a odpovědí studenta na položené otázky rozhodla práci hodnotit stupněm " A ". Otázky u obhajoby: You wrote that the first results were bad, what does it mean? What was the EER? What was the main change in the final system? Did you do any per phoneme statistics with the output of phoneme verification? What context dependent phonemes were worst, which best? Can you do any conclusion out of it like dependencies on occurrence in training data? Did you try to train ivector for reparametrization on long utterances? It is not good to train ivector on short excerpts of audio according to my experience. Did you try to use the baseline system for reparametrization? It would be needed to use LDA for dimensionality reduction from 400 to 40 or 60, but the LDA can be trained to extract only speaker information.cs
but.jazykangličtina (English)
but.programInformační technologiecs
but.resultpráce byla úspěšně obhájenacs
dc.contributor.advisorČernocký, Janen
dc.contributor.authorFér, Radeken
dc.contributor.refereeMatějka, Pavelen
dc.date.created2014cs
dc.description.abstractTato práce se zabývá extrakcí vhodných příznaků pro rozpoznávání řečníka z delších časových úseků. Po představení současných technik pro extrakci takových příznaků navrhujeme a popisujeme novou metodu pracující v časovém rozsahu fonémů a využívající známou techniku i-vektorů. Velké úsilí bylo vynaloženo na nalezení vhodné reprezentace temporálních příznaků, díky kterým by mohly být systémy pro rozpoznávání řečníka robustnější, zejména modelování prosodie. Náš přístup nemodeluje explicitně žádné specifické temporální parametry řeči, namísto toho používá kookurenci řečových rámců jako zdroj temporálních příznaků. Tuto techniku testujeme a analyzujeme na řečové databázi NIST SRE 2008. Z výsledků bohužel vyplývá, že pro rozpoznávání řečníka tato technika nepřináší očekávané zlepšení. Tento fakt diskutujeme a analyzujeme ke konci práce.en
dc.description.abstractThis work deals with temporal features for automated speaker recognition. We give overview of currently known temporal feature extraction methods and afterwards, we propose and preliminarily evaluate a general phoneme-level temporal feature extraction scheme based on factor analysis i-vector paradigm. Much effort has been made to reasonably represent temporal context and make speaker recognition systems more robust, namely speech prosody modeling. Our approach does not explicitly model any temporal parameters of speech, rather it uses the occurrence of neighboring frames as a source of temporal information. We test and analyze this method on standard evaluation database NIST SRE 2008. The results indicate, however, that for speaker recognition, no useful gain can be obtained using this technique. We describe and discuss this discovery at the end.cs
dc.description.markAcs
dc.identifier.citationFÉR, R. Speaker Recognition Based on Long Temporal Context [online]. Brno: Vysoké učení technické v Brně. Fakulta informačních technologií. 2014.cs
dc.identifier.other88474cs
dc.identifier.urihttp://hdl.handle.net/11012/53364
dc.language.isoencs
dc.publisherVysoké učení technické v Brně. Fakulta informačních technologiícs
dc.rightsStandardní licenční smlouva - přístup k plnému textu bez omezenícs
dc.subjectrozpoznávání řečníkaen
dc.subjecttemporální příznakyen
dc.subjecti-vektoryen
dc.subjectparametrizace řečien
dc.subjectspeaker recognitioncs
dc.subjecttemporal featurescs
dc.subjecti-vectorscs
dc.subjectspeech parametrizationcs
dc.titleSpeaker Recognition Based on Long Temporal Contexten
dc.title.alternativeSpeaker Recognition Based on Long Temporal Contextcs
dc.typeTextcs
dc.type.drivermasterThesisen
dc.type.evskpdiplomová prácecs
dcterms.dateAccepted2014-08-27cs
dcterms.modified2020-05-10-16:11:47cs
eprints.affiliatedInstitution.facultyFakulta informačních technologiícs
sync.item.dbid88474en
sync.item.dbtypeZPen
sync.item.insts2025.03.26 15:18:20en
sync.item.modts2025.01.15 13:19:41en
thesis.disciplinePočítačová grafika a multimédiacs
thesis.grantorVysoké učení technické v Brně. Fakulta informačních technologií. Ústav počítačové grafiky a multimédiícs
thesis.levelInženýrskýcs
thesis.nameIng.cs
Files
Original bundle
Now showing 1 - 2 of 2
Loading...
Thumbnail Image
Name:
final-thesis.pdf
Size:
1.28 MB
Format:
Adobe Portable Document Format
Description:
final-thesis.pdf
Loading...
Thumbnail Image
Name:
review_88474.html
Size:
1.44 KB
Format:
Hypertext Markup Language
Description:
file review_88474.html
Collections