h1

h2

h3

h4

h5
h6
http://join2-wiki.gsi.de/foswiki/pub/Main/Artwork/join2_logo100x88.png

Improving statistical machine translation using morpho-syntactic information



Verantwortlichkeitsangabevorgelegt von Sonja Nießen

ImpressumAachen : Publikationsserver der RWTH Aachen University 2002

UmfangVIII, 107 S. : Ill., graph. Darst.


Aachen, Techn. Hochsch., Diss., 2002

Prüfungsjahr: 2002. - Publikationsjahr: 2003


Genehmigende Fakultät
Fak01

Hauptberichter/Gutachter


Tag der mündlichen Prüfung/Habilitation
2002-12-02

Online
URN: urn:nbn:de:hbz:82-opus-5448
DOI: 10.18154/RWTH-CONV-120674
URL: https://publications.rwth-aachen.de/record/58844/files/58844.pdf

Einrichtungen

  1. Fakultät für Mathematik, Informatik und Naturwissenschaften (100000)

Inhaltliche Beschreibung (Schlagwörter)
Informatik (frei) ; statistical machine translation (frei) ; morphological and syntactic information (frei) ; quality evaluation (frei) ; machine learning (frei) ; maximum entropy (frei)

Thematische Einordnung (Klassifikation)
DDC: 004

Kurzfassung
Bei der statistischen maschinellen Übersetzung (SMT) wird die Korrespondenz von Wörtern in Quell- und Zielsprache anhand von bilingualen Corpora gelernt. Häufig geht wenig oder gar kein linguistisches Wissen zur Strukturierung der Modelle ein. Die hier dargestellte Arbeit ist motiviert durch die Beobachtung, dass das Trainingsmaterial typischerweise die Eigenheiten natürlicher Sprachen nicht ausreichend widerspiegelt. Es werden verschiedene Methoden zur Einbettung morphologischer und syntaktischer Information in SMT-Systeme vorgestellt. Ziel ist die Verbesserung der Übersetzungsqualität und die Verringerung der zum Training Datenmenge. Es ist schwierig für Alignierungsalgorithmen, größere Unterschiede in der Wortstellung zwischen einander entsprechenden Sätzen zu behandeln. In dieser Arbeit wird eine Reihe von Umordnungsoperationen eingeführt, die auf Wissen über die Satzstruktur in den beteiligten Sprachen fußen. Zweck dieser Transformationen ist es, verwandte Sätze einander anzugleichen. Ihre Anwendung führt zu besseren Wortalignments und folglich zu weniger verrauschten probabilistischen Lexika, zu breiterer Anwendbarkeit von Mehrwortphrasen und zu einer besseren Abdeckung durch das Zielsprachmodell. Die existierenden SMT-Systeme betrachten verschiedene Wortformen des gleichen Lemmas als unabhängig voneinander. Das bilinguale Trainingsmaterial kann durch explizite Einbeziehung der wechselseitigen Abhängigkeiten verwandter Wortformen besser ausgeschöpft werden. In dieser Arbeit wird eine Hierarchie von Äquivalenzklassen definiert, die auf morphologischer und syntaktischer Information über die Oberflächenformen hinaus beruht. Durch die Kombination von Merkmalen aus den verschiedenen Hierarchieebenen werden hierarchische Lexikon- modelle gebildet, die die üblichen probabilistischen Lexika ersetzen. Diese kombinierten Modelle haben zweifachen Nutzen: Erstens können die Übersetzungen für ungesehene Wortformen aus Informationen hergeleitet werden, die von tieferen Ebenen in der Hierarchie stammen. Zum Zweiten machen sie syntaktische Kontextinformation lokal zugreifbar macht. Das Sammeln von Texten und ihre Übersetzung zur Bereitstellung von Korpora für das Training der Modellparameter ist mühsam und teuer. In dieser Arbeit wird systematisch untersucht, wieviel paralleles Trainingsmaterial notwendig ist, um eine akzeptable Übersetzungsqualität zu erreichen. Alle hier dargestellten Methoden tragen zu einer verbesserten Ausschöpfung der Daten und folglich zu einer Verbesserung der Übersetzungsqualität insbesondere im Fall von knappen Datenresourcen bei. Durch die Kombination der vorgeschlagenen Methoden können erhebliche Verbesserungen nachgewiesen werden für die Aufgaben Verbmobil, Nespole und Zeres, und zwar für die Übersetzung von Deutsch nach Englisch und umgekehrt, bei Texteingabe und Eingabe gesprochener Sprache. Thema des zweiten Teils dieser Arbeit ist die Bewertung von Übersetzungen. Es wurde ein Werkzeug für diesen Zweck entwickelt, das den Anforderungen im Forschungsumfeld Rechnung trägt. Des weiteren wurden Evaluationsmaße definiert, die angemessener sind als einfacher Editierabstand. Die Bewertung erfolgt halbautomatisch auf schnelle, bequeme und konsistente Weise unter Verwendung der graphischen Benutzeroberfläche. Die Qualitätsmaße selbst werden systematisch verglichen.

In the framework of statistical machine translation (SMT), correspondences between the words in the source and the target language are learned from bilingual corpora, and often little or no linguistic knowledge is used to structure the underlying models. The work presented in this thesis is motivated by the observation that training data typically does not sufficiently represent the phenomena in natural languages. Various methods of incorporating morphological and syntactic information into SMT systems are proposed and systematically assessed. The overall goal is to improve translation quality and to reduce the amount of parallel text necessary to train the model parameters. Large differences in word order between corresponding sentences are difficult to capture for automatic alignment algorithms. In this work, sentence level restructuring transformations are introduced which are motivated by the sentence structure in the involved languages. These transformations aim at the assimilation of word orders in related sentences. Their application results in better alignments and as a consequence in cleaner probabilistic lexica, broader applicability of multi-word phrase pairs and a better coverage of the language model. Existing SMT systems often treat different inflected forms of the same lemma as if they were independent of each other. A better exploitation of the bilingual training data can be achieved by taking into account the interdependencies of related inflected forms. In this work a hierarchy of equivalence classes is defined on the basis of morphological and syntactic information. Features from those hierarchy levels are combined to form hierarchical lexicon models which can replace the standard lexicon used in most SMT systems. The benefit from these combined models is twofold: Firstly, the translation of unseen word forms can be derived by considering information from lower levels in the hierarchy. Secondly, category ambiguity can be resolved, because syntactical context information is made locally accessible. It is a costly and time consuming task to gather large texts and have them translated to form bilingual corpora. In this work the amount of bilingual data required to achieve an acceptable translation quality is systematically investigated. All the methods presented in this thesis contribute to a better exploitation of the available data and thus to improving translation quality in frameworks with scarce resources. The combination of the suggested methods results in substantial improvements on tasks from the projects Verbmobil, Nespole and EuTrans, for German to English and English to German translation and for text and speech input. The second focus of this thesis is on evaluation of MT quality. A tool for the evaluation of translation quality which accounts for the requirements in a research environment is developed. Evaluation criteria which are more adequate than edit distance are defined. The measurement along these quality criteria is performed semi-automatically in a fast, convenient and consistent way using the graphical user interface. The quality criteria themselves are systematically assessed.

OpenAccess:
Download fulltext PDF
(additional files)

Dokumenttyp
Dissertation / PhD Thesis

Format
online, print

Sprache
English

Externe Identnummern
HBZ: HT013664043

Interne Identnummern
RWTH-CONV-120674
Datensatz-ID: 58844

Beteiligte Länder
Germany

 GO


OpenAccess

QR Code for this record

The record appears in these collections:
Document types > Theses > Ph.D. Theses
Faculty of Mathematics and Natural Sciences (Fac.1) > No department assigned
Publication server / Open Access
Public records
Publications database
100000

 Record created 2013-01-28, last modified 2026-06-10


OpenAccess:
Download fulltext PDF
(additional files)
Rate this document:

Rate this document:
1
2
3
 
(Not yet reviewed)