Bakalářská práce

Rozbor chyb syntaktické analýzy češtiny

Analysis of errors in parsing of Czech

Pavel Ondruš, učo 324506
Anotace

Práce popisuje rozbor chyb na výstupu syntaktického analyzátoru Synt, vyvíjeného v Centru zpracování přirozeného jazyka, které sídlí na FI MU. Je zde obecně popsána syntaktická analýza, analyzátor Synt a převedení výstupních stromů na zjednodušené stromy. Dále se pak práce zaměřuje na postup úpravy stromů na výstupu Syntu, jednotlivé kroky úpravy a vytváření limitů. Následuje popis jednotlivých chyb …více

Abstract

This thesis describes the analysis of errors at the output of syntactic parser Synt, developed in the Center of Natural Language Processing, which is located at FI MU. There is generally described parser, analyzer Synt and transfer to the beautified output trees trees. The work focuses on how to modify the output Synt trees, how to edit it and creating limits. Another part is a description of each …více

Zadání práce

Syntaktická analýza (parsing) patří k základním úlohám zpracování přirozeného jazyka. Na rozdíl od analýzy formálních jazyků naráží na masivní nejednoznačnost jazyků přirozených, což je jedna ze zásadních příčin, proč stávající systémy stále nedosahují požadované přesnosti při pokrytí běžných (např. korpusových) textů. Cílem této práce je manuální rozbor a podrobná statistická klasifikace chyb ve výstupu parseru Synt pro netriviální počet českých vět s chybnou analýzou (min. 300). Student nastuduje základní metody a algoritmy použité syntaktické analýzy, gramatický formalismus, na němž je postavena, její vazbu na předcházející morfologickou analýzu jazyka, poté provede požadovaný rozbor a navrhne úpravy potřebné pro zlepšení analýzy.
Výstupem práce bude podrobná analýza kvantifikující faktory zapřičiňující neúspěšnou analýzu, přegenerování při úspěšné analýze a chyby v pořadí (skóre) výstupních stromů.

Práce je součástí projektů spojených s činností Laboratoře zpracování přirozeného jazyka a jako taková bude vyžadovat pravidelné zveřejňování dosažených výsledků ve formě souhrnné zprávy vždy na konci každého kalendářního měsíce po celou dobu řešení. Tyto zprávy budou vystaveny na webových stránkách Laboratoře. Řešiteli bude zřízen účet na hlavním serveru, případně i na pracovních stanicích Laboratoře.

Práce je vypisována v rámci projektu OP VK s názvem Platforma výzkumné a vzdělávací spolupráce FI MU v oblasti zpracování dat, reg.č.CZ.1.07/2.4.00/12.0049, a aktivit SPP.

Práce zkontrolována:
24. 5. 2012 14:05, RNDr. Miloš Jakubíček, Ph.D., učo 172962
Plný text práce
924,3 KB / soubor PDF
Jazyk práce
čeština čeština
Termín obhajoby
19. 6. 2012
Práce byla úspěšně obhájena

Vedoucí

RNDr. Miloš Jakubíček, Ph.D., učo 172962
CZPJ KSUZD FI MU

Oponent

RNDr. Vojtěch Kovář, Ph.D., učo 139915
ÚČJ FF MU

Literatura

  • HORÁK, Aleš. Computer Processing of Czech Syntax and Semantics. 1st edition. Brno, Czech Republic: Librix.eu, 2008, 241 s. 1st edition. ISBN 978-80-7399-375-7.
  • JAKUBÍČEK, Miloš. Extrakce strukturních informací z běžného textu na základě syntaktického analyzátoru. Masarykova Univerzita, 2008.

Masarykova univerzita Fakulta informatiky
Studijní program
Aplikovaná informatika
 
Název
Vložil
Vloženo
Práva
  • Přidání souboru

    Soubor nebo složku lze nahrát pomocí tlačítka Přidat.
  • Další operace se soubory

    Podrobnosti lze zjistit označením příslušného řádku.
  • Pohled pro experty

    Pro častou práci je možné zvolit režim Více možností.
  • Vyhledávání souborů

    Vyhledávaný výraz můžete zadat přímo do adresního řádku.
  • Rychlý přístup k souborům

    Pomocí funkce Nedávné je možné se rychle vrátit k právě prohlíženým souborům. Oblíbené soubory je také možné označit Hvězdičkou.