Bakalářská práce

Korpus jako zdroj dat pro optimalizaci automatické morfologické analýzy

Corpus as Source of Amendements for Automatic Morphological Analysis

Daniela Ryšavá, učo 399364
Anotace

Bakalářská práce se zabývá homonymními tvary příjmení a l-ových příčestí jako jedním z problémů automatické morfologické analýzy (AMA). Popisujeme zde proces AMA a její vývoj v korpusech Českého národního korpusu. V praktické části analyzujeme příjmení zachycená v morfologickém slovníku, zkoumáme případy, kdy jsou chybně označená jako slovesa. Na základě chybných kontextů v korpusu SYN nabízíme dotazy pro zjišťování nedostatků v pokrytí automatické morfologické analýzy.

Abstract

The bachelor's thesis deals with homonymous forms of surnames and past participles ending in -l as one of the problems of the automatic morphological analysis. We describe the process and progress the AMA in corpora of the Czech national corpus. We analyse surnames detected in the morphological dictionary in the practical part, we research occurrences of incorrectly tagged as verbs. We offer queries for searching shortages in coverage AMA based on erroneous contexts in corpus SYN.

Zadání práce
Automatická morfologická analýza přirozeného jazyka se potýká s řadou problémů. Jednu z největších obtíží představuje v češtině tvarová homonymie. Homonymií rozumíme případy, kdy jednomu slovnímu tvaru (v korpusové lingvistice jednotce typu „word“) přiřadí automatická morfologická analýza více než jednu interpretaci, kterou je třeba následně desambiguovat – zjednoznačnit. Hlavní metody desambiguace jsou a) statistické, b) pravidlové a c) hybridní. Druhou obtíží automatické morfologické analýzy je pokrytí slovníku (ve slovníku nejsou zaznamenány všechny interpretace jednotek, které se v textech, z nichž se korpus skládá, reálně vyskytují). Práce se zaměří na jeden z problémů, jímž je rozpoznávání proprií, konkrétně příjmení, která mají tvary homonymní s tvary l-ových příčestí (Hrabal, Nezval, Musil). Na úrovni automatické morfologické analýzy jsou ve slovníku zachycena pouze některá příjmení uvedeného typu. V praktické části diplomand ověří výsledky disambiguace. Řada příjmení zmíněného typu není na rovině slovníku zachycena a příslušné tvary jsou mylně interpretovány jako tvary l-ových příčestí (Přiklopil, Kazil, Dostrašil). Pokrytí slovníku je průběžně vylepšováno (slovník se průběžně doplňuje o interpretace nalezené v korpusech). Diplomand navrhne postupy, jimiž lze z korpusů čerpat informace o chybné desambiguaci tvarů, které nemají na úrovni slovníku automatického morfologického analyzátoru patřičnou interpretaci. Postupy vyhledávání se budou opírat o gramatická pravidla. Cílem práce není nalézt co nejvíce případů nedostatečného pokrytí slovníku, ale vytvořit podklady pro formulování lingvisticky založených pravidel, která by bylo možné použít pro pravidlovou desambiguaci.
Práce zkontrolována:
25. 5. 2015 12:44, prof. PhDr. Klára Osolsobě, Dr., učo 1996
Jazyk práce
čeština čeština
Termín obhajoby
4. 6. 2015
Práce byla úspěšně obhájena

Vedoucí

prof. PhDr. Klára Osolsobě, Dr., učo 1996
ÚČJ FF MU

Oponent

Mgr. Kateřina Najbrtová, Ph.D., učo 145034
OVV Děk FF MU

  • Přidání souboru

    Soubor nebo složku lze nahrát pomocí tlačítka Přidat.
  • Další operace se soubory

    Podrobnosti lze zjistit označením příslušného řádku.
  • Pohled pro experty

    Pro častou práci je možné zvolit režim Více možností.
  • Vyhledávání souborů

    Vyhledávaný výraz můžete zadat přímo do adresního řádku.
  • Rychlý přístup k souborům

    Pomocí funkce Nedávné je možné se rychle vrátit k právě prohlíženým souborům. Oblíbené soubory je také možné označit Hvězdičkou.