Určování typů entit na základě extrakce informací z Wikipedie

Loading...
Thumbnail Image

Date

Authors

Rusiňák, Petr

Mark

C

Journal Title

Journal ISSN

Volume Title

Publisher

Vysoké učení technické v Brně. Fakulta informačních technologií

ORCID

Abstract

Cílem této práce je identifikovat typy článků na Wikipedii (např. rozlišit články o osobách od článků o sportovních utkáních), přičemž tento systém by měl být použitelný pro libovolný typ extrahované entity. Vstupem pro tento systém je seznam několika vzorových článků patřících do hledané entity a seznam několika článků nepatřících do této entity. Na základě těchto seznamů budou vygenerovány příznaky, které lze použít k nalezení všech článků patřící do této entity. Tyto příznaky mohou být založeny jak na základě strukturovaných informací na Wikipedii (např. šablony, kategorie), tak i na základě analýzy přirozeného textu v první větě článku, kde bude nalezeno definiční podstatné jméno vystihující entitu daného článku. Tento systém podporuje extrakci česky a anglicky psaných článků a je rozšířitelný pro podporu dalších jazyků.
This paper presents a system for identifying entity types of articles on Wikipedia (e.g. people or sports events) that can be used for identifaction of any arbitrary entity. The~input files for this system are a list of several pages that belong to this entity and a list of several pages that do not belong to this entity. These lists will be used to generate features that can be used for generation of the list of all pages belonging to this entity. The fatures can be based on both structured information on Wikipedia such as templates and categories and non-structured informations found by the analysis of natural text in the first sentence of the article where a defining noun that represents what the article is about will be found. This system support pages written in Czech and English and can be extended to support other languages.

Description

Citation

RUSIŇÁK, P. Určování typů entit na základě extrakce informací z Wikipedie [online]. Brno: Vysoké učení technické v Brně. Fakulta informačních technologií. 2018.

Document type

Document version

Date of access to the full text

Language of document

cs

Study field

Informační technologie

Comittee

doc. Dr. Ing. Dušan Kolář (předseda) doc. Ing. Jaroslav Zendulka, CSc. (místopředseda) Ing. František Grézl, Ph.D. (člen) doc. Ing. Zdeněk Kotásek, CSc. (člen) Dr. Ing. Petr Peringer (člen)

Date of acceptance

2018-06-14

Defence

Student nejprve prezentoval výsledky, kterých dosáhl v rámci své práce. Komise se poté seznámila s hodnocením vedoucího a posudkem oponenta práce. Student následně odpověděl na otázky oponenta a na další otázky přítomných. Komise se na základě posudku oponenta, hodnocení vedoucího, přednesené prezentace a odpovědí studenta na položené otázky rozhodla práci hodnotit stupněm " C ". Otázky u obhajoby: V kapitole 8 "Výsledky" bych očekával podrobnější srovnání Vašeho systému s DBpedií. Můžete komisi ukázat výsledky tohoto srovnání na několika typech entit. Jaké články správně identifikoval Váš systém oproti DBpedii? Jaké články správně identifikovala DBpedie oproti Vašemu systému? Jaké jsou výhody Vašeho systému oproti DBpedii?

Result of defence

práce byla úspěšně obhájena

DOI

Collections

Endorsement

Review

Supplemented By

Referenced By

Citace PRO