Závěrečná práce: Pavel Ondruš, učo 324506: Rozbor chyb syntaktické analýzy češtiny
Bakalářská práce
Rozbor chyb syntaktické analýzy češtiny
Analysis of errors in parsing of Czech
Anotace
Práce popisuje rozbor chyb na výstupu syntaktického analyzátoru Synt, vyvíjeného v Centru zpracování přirozeného jazyka, které sídlí na FI MU. Je zde obecně popsána syntaktická analýza, analyzátor Synt a převedení výstupních stromů na zjednodušené stromy. Dále se pak práce zaměřuje na postup úpravy stromů na výstupu Syntu, jednotlivé kroky úpravy a vytváření limitů. Následuje popis jednotlivých chyb …více
Abstract
This thesis describes the analysis of errors at the output of syntactic parser Synt, developed in the Center of Natural Language Processing, which is located at FI MU. There is generally described parser, analyzer Synt and transfer to the beautified output trees trees. The work focuses on how to modify the output Synt trees, how to edit it and creating limits. Another part is a description of each …více
Zadání práce
Syntaktická analýza (parsing) patří k základním úlohám zpracování přirozeného jazyka. Na rozdíl od analýzy formálních jazyků naráží na masivní nejednoznačnost jazyků přirozených, což je jedna ze zásadních příčin, proč stávající systémy stále nedosahují požadované přesnosti při pokrytí běžných (např. korpusových) textů. Cílem této práce je manuální rozbor a podrobná statistická klasifikace chyb ve výstupu parseru Synt pro netriviální počet českých vět s chybnou analýzou (min. 300). Student nastuduje základní metody a algoritmy použité syntaktické analýzy, gramatický formalismus, na němž je postavena, její vazbu na předcházející morfologickou analýzu jazyka, poté provede požadovaný rozbor a navrhne úpravy potřebné pro zlepšení analýzy.
Výstupem práce bude podrobná analýza kvantifikující faktory zapřičiňující neúspěšnou analýzu, přegenerování při úspěšné analýze a chyby v pořadí (skóre) výstupních stromů.
Práce je součástí projektů spojených s činností Laboratoře zpracování přirozeného jazyka a jako taková bude vyžadovat pravidelné zveřejňování dosažených výsledků ve formě souhrnné zprávy vždy na konci každého kalendářního měsíce po celou dobu řešení. Tyto zprávy budou vystaveny na webových stránkách Laboratoře. Řešiteli bude zřízen účet na hlavním serveru, případně i na pracovních stanicích Laboratoře.
Práce je vypisována v rámci projektu OP VK s názvem Platforma výzkumné a vzdělávací spolupráce FI MU v oblasti zpracování dat, reg.č.CZ.1.07/2.4.00/12.0049, a aktivit SPP.
24. 5. 2012 14:05, RNDr. Miloš Jakubíček, Ph.D., učo 172962
- Zadáno/změněno 20. 6. 2012 10:34, Helena Kryštofová
- Záznam založen 24. 4. 2012 08:27, Alena Dvořáková
- Zveřejnit od 21. 5. 2012 10:32, Alena Dvořáková
- Práce převzata 21. 5. 2012 10:32, Alena Dvořáková
Vedoucí
Literatura
- HORÁK, Aleš. Computer Processing of Czech Syntax and Semantics. 1st edition. Brno, Czech Republic: Librix.eu, 2008, 241 s. 1st edition. ISBN 978-80-7399-375-7.
- JAKUBÍČEK, Miloš. Extrakce strukturních informací z běžného textu na základě syntaktického analyzátoru. Masarykova Univerzita, 2008.
Práce na příbuzné téma
Seznam prací, které mají shodná klíčová slova.
-
Identifikace syntakticky nejednoznačných vět
Mgr. Bc. Štěpán Mach, učo 333368 -
Extrakce strukturních informací z běžného textu na základě syntaktického analyzátoru
RNDr. Miloš Jakubíček, Ph.D., učo 172962 -
Automatická oprava chybného uvození vedlejších vět
Mgr. Bc. Štěpán Mach, učo 333368 -
Dialogový systém pro akvizici informací
Bc. Pavel Bernát -
Algoritmy kvalitativního ohodnocení výstupu syntaktické analýzy české věty
RNDr. Vojtěch Kovář, Ph.D., učo 139915 -
Madagascar: Guide culturel, traduction et analyse linguistique et traductologique
Bc. Pavlína Bělehradová -
Nástroje pro vyhledávání definic a použití v jazyce C
Mgr. Erich Duda -
Extrakce informací z burzovních zpráv
Mgr. Jozef Štyrák




