h1

h2

h3

h4

h5
h6
http://join2-wiki.gsi.de/foswiki/pub/Main/Artwork/join2_logo100x88.png

Neural machine translation for low-resource scenarios = Neuronale maschinelle Übersetzung für ressourcenarme Szenarien



Verantwortlichkeitsangabevorgelegt von M.Sc. Software Systems Engineering Yunsu Kim

ImpressumAachen : RWTH Aachen University 2022

Umfang1 Online-Ressource : Illustrationen


Dissertation, RWTH Aachen University, 2022

Englische und deutsche Zusammenfassung. - Veröffentlicht auf dem Publikationsserver der RWTH Aachen University


Genehmigende Fakultät
Fak01

Hauptberichter/Gutachter
;

Tag der mündlichen Prüfung/Habilitation
2022-02-07

Online
DOI: 10.18154/RWTH-2022-02241
URL: https://publications.rwth-aachen.de/record/842123/files/842123.pdf

Einrichtungen

  1. Lehrstuhl für Informatik 6 (Maschinelles Lernen) (122010)
  2. Fachgruppe Informatik (120000)

Inhaltliche Beschreibung (Schlagwörter)
artificial intelligence (frei) ; künstliche Intelligenz (frei) ; machine learning (frei) ; machine translation (frei) ; maschinelle Übersetzung (frei) ; maschinelles Lernen (frei)

Thematische Einordnung (Klassifikation)
DDC: 004

Kurzfassung
Die maschinelle Übersetzung wird seit Jahrzehnten hauptsächlich durch statistisches Lernen zweisprachiger Textdaten angegangen. In dem jüngsten Paradigma mit neuronalen Netzen erfordert der Aufbau eines maschinellen Übersetzungssystems mehr Daten als je zuvor, um die hochmoderne Modellierungskapazität optimal zu nutzen und eine angemessene Leistung zu erzielen. Leider gibt es für viele Sprachpaare und Domänen nicht genügend zweisprachige Korpora. Um die Abdeckung der neuronalen maschinellen Übersetzung zu erweitern, werden in dieser Arbeit effektive Methoden zur Verbesserung der Leistung in solchen ressourcenarmen Szenarien untersucht. Zunächst untersuchen wir die Verwendung einsprachiger Korpora für die neuronale maschinelle Übersetzung. Wir optimieren die logarithmische lineare Integration eines Sprachmodells in die Übersetzungsdecodierung. Als Nächstes überprüfen wir verschiedene Strategien zur Erzeugung synthetischer Daten und vergleichen ihre empirische Leistung im Maßstab. Darüber hinaus untersuchen wir das Vorlernen und das Multitask-Lernen eines Übersetzungsmodells mit Sprachmodellierung und den Cloze-Task-Modellierungszielen. Wir vergleichen alle diese Methoden empirisch, um die beste Vorgehensweise für halbüberwachtes Lernen zur Kompensation der Leistung in einem Fall mit geringen Ressourcen bereitzustellen. Zweitens untersuchen wir den mehrsprachigen Transfer von einer Einstellung mit hohen Ressourcen zu einer Einstellung mit niedrigen Ressourcen. Diese Studie deckt zwei pragmatische Szenarien ab: Übertragung zwischen den Sprachpaaren, deren Zielseite gemeinsam ist, und Übertragung von mehreren Sprachpaaren basierend auf einer Pivot-Sprache, z.B. für ein nicht englisches Sprachpaar mit Englisch als Pivot. Für beide Szenarien entwickeln wir eine Reihe von sequentiellen Übertragungstechniken, um die Effektivität der Übertragung zu maximieren. Die Techniken werden gründlich mit halbüberwachten Baselines, mehrsprachigen Modellen und kaskadierten Architekturen verglichen. Zuletzt untersuchen wir unbeaufsichtigtes Lernen für die neuronale maschinelle Übersetzung, bei der nur einsprachige Korpora zum Trainieren eines Übersetzungsmodells verwendet werden. Wir behandeln die Methoden von der klassischen Entschlüsselung bis zum Sequenz-zu-Sequenz-Training und geben einen historischen Überblick über die unbeaufsichtigte Übersetzung. Zur Entschlüsselung erweitern wir sein primitives Framework auf die Übersetzung großer Vokabeln, indem wir die Lexikongrößen im Training reduzieren und Lexika für neuronale Netze verwenden. Darüber hinaus integrieren wir ein mehrsprachiges Lexikonmodell zur Worteinbettung und wenden einen Autoencoder mit neuronaler Entrauschung als Nachbearbeitung an, was zu einer neuartigen kaskadierten Kombination führt. Dann analysieren wir die ausgefeilteste Methode zum Erlernen eines Sequenz-zu-Sequenz-Modells, einschließlich umfangreicher experimenteller Ergebnisse zu zahlreichen Dateneinstellungen, um herauszufinden, unter welchen Bedingungen unbeaufsichtigtes Lernen in der Praxis nützlich ist.

Machine translation has been tackled for decades mainly by statistical learning on bilingual text data. In the most recent paradigm with neural network modeling, building a machine translation system requires more data than ever to make the best use of the state-of-the-art modeling capacity and yield a reasonable performance. Unfortunately, however, there is not a sufficient amount of bilingual corpora for many language pairs and domains. To expand the coverage of neural machine translation, this thesis investigates effective methods to improve the performance in such low-resource scenarios. Firstly, we study the usage of monolingual corpora for neural machine translation. To begin with, we optimize the log-linear integration of a language model into translation decoding. Next, we review various synthetic data generation strategies and compare their empirical performance at scale. In addition, we investigate pre-training and multi-task training of a translation model with language modeling and the Cloze task modeling objectives. We compare all these methods empirically to provide best practice for semi-supervised learning to compensate for the performance in a low-resource case. Secondly, we examine the cross-lingual transfer from a high-resource setting to a low-resource setting. This study covers two pragmatic scenarios: transfer between the language pairs whose target side is common and transfer from multiple language pairs based on a pivot language, e.g. for a non-English language pair with English as the pivot. For both scenarios, we develop a series of sequential transfer techniques to maximize the effectiveness of the transfer. The techniques are thoroughly compared to semi-supervised baselines, multilingual models and cascaded architectures. Lastly, we investigate unsupervised learning for neural machine translation, where only monolingual corpora are used to train a translation model. We cover the methods from classical decipherment to sequence-to-sequence training, giving a historical overview of unsupervised translation. For decipherment, we extend its primitive framework to large vocabulary translation by reducing lexicon sizes in training and employing neural network lexicons. Furthermore, we integrate a cross-lingual word embedding lexicon model and apply a neural denoising autoencoder as a postprocess, leading to a novel cascaded combination. Finally, we analyze the most sophisticated method with a sequence-to-sequence model, including extensive experimental results on numerous data settings to find out under which conditions unsupervised learning is useful in practice.

OpenAccess:
Download fulltext PDF
(additional files)

Dokumenttyp
Dissertation / PhD Thesis

Format
online

Sprache
English

Externe Identnummern
HBZ: HT021281769

Interne Identnummern
RWTH-2022-02241
Datensatz-ID: 842123

Beteiligte Länder
Germany

 GO


OpenAccess

QR Code for this record

The record appears in these collections:
Document types > Theses > Ph.D. Theses
Publication server / Open Access
Faculty of Computer Science (Fac.9)
Public records
Publications database
120000
122010

 Record created 2022-03-01, last modified 2025-10-15


OpenAccess:
Download fulltext PDF
(additional files)
Rate this document:

Rate this document:
1
2
3
 
(Not yet reviewed)