2026
Dissertation, RWTH Aachen University, 2026
Veröffentlicht auf dem Publikationsserver der RWTH Aachen University
Genehmigende Fakultät
Fak09
Hauptberichter/Gutachter
;
Tag der mündlichen Prüfung/Habilitation
2026-06-12
Online
DOI: 10.18154/RWTH-2026-06051
URL: https://publications.rwth-aachen.de/record/1037447/files/1037447.pdf
Einrichtungen
Projekte
Inhaltliche Beschreibung (Schlagwörter)
discriminative training (frei) ; language model (frei) ; machine learning (frei) ; speech recognition (frei)
Thematische Einordnung (Klassifikation)
DDC: 004
Kurzfassung
Um das Training immer größerer Spracherkennungssysteme zu befeuern ist ein wachsender Berg an bimodalen Trainingsdaten vonnöten, die sowohl einen Text als auch dessen akustische Repräsentation beinhalten. Die Menge der verfügbaren, qualitativ hochwertigen Trainingsdaten ist aktuell der größte Engpass bei der Weiterentwicklung der automatischen Spracherkennungssysteme. Ein weiterer Ansatz zur Verbesserung der Spracherkennung sind Sprachmodelle, die den semantischen Kontext der Sprache einfangen. Diese benötigen ausschließlich Textdaten und können deshalb - und wurden bereits - auf unvorstellbar großen Datenmengen trainiert. In dieser Arbeit werden wir untersuchen, wie solche Sprachmodelle enger in das Training von akustischen Modellen integriert werden können, um die Qualität des Gesamtsystems zu verbessern. Zunächst betrachten wir das diskriminative Training von hybriden akustischen Modellen. Wir stellen ein neues diskriminatives Trainingskriterium vor, welches wir frame-level maximum mutual information nennen. Es ist eng mit dem state-level Bayes risk Kriterium verwandt, jedoch sollte dieses im Training angewandt zu einer näher an der wahren Verteilung liegenden Modellverteilung führen. Obwohl wir keine Verbesserung der Wortfehlerrate festgestellt haben, konnten wir doch eine qualitative Veränderung der Modellverteilungen beobachten, welche beim Training mit dem neuen Kriterium deutlich weicher waren. Anschließend schlagen wir vor, ein Sprachmodell mit Hilfe von log-linearer Kombination in das Training von Attention-basierten Encoder-Decoder Modellen zu integrieren. Die Normierung auf Satzebene führt zu einem diskriminativen Trainingskriterium, welches wir, wegen seiner Ähnlichkeit zum entsprechenden Kriterium für hybride Modelle, maximum mutual information nennen. Wir untersuchen mögliche Näherungen für die Normierung und die nötige Größe des Suchraums, um alle relevanten Beiträge einzufangen. Die Art des zu kombinierenden Sprachmodells wird untersucht um herauszufinden, welche Eigenschaften für eine Trainingsintegration am besten geeignet sind. Das neue Kriterium wird darauf mit dem existierenden expected error Kriterium verglichen und wir erreichen eine konkurrenzfähige Wortfehlerrate. Daraufhin wollen wir die erhöhte Trainingsdauer und -komplexität des Kriteriums verbessern, indem wir die Normierung stattdessen auf Symbolebene durchführen. Wir zeigen dass die gleichen Verbesserungen in der Wortfehlerrate erreichbar sind ohne jedoch die Trainingsdauer des Referenztrainings signifikant zu erhöhen. Zusätzlich zeigen wir, dass der Modellkombinationsansatz mittels gelernter, symbolabhängiger Skalierungsexponenten verbessert werden kann, solange das akustische Modell nicht gemeinsam mit den Exponenten und dem Sprachmodell trainiert wird. Zuletzt untersuchen wir den Zusammenhang zwischen einer Sprachmodellintegration im Training und dem internen Sprachmodell, welches implizit im Decoder des akustischen Modells gelernt wird. Wir zeigen, dass der Großteil der Verbesserung durch Trainingsintegration durch ein Unterdrücken des internen Sprachmodells erreicht wird. Deshalb werden die Verbesserungen der Wortfehlerrate durch die Integration eines Sprachmodells in den Trainingsprozess ebenfalls durch ein Modell zur Korrektur des internen Sprachmodells während der Erkennung eingefangen.To fuel the training of ever more powerful and accurate speech recognition systems a mountain of bimodal training data is necessary, that includes both the acoustic representation of speech along with the textual transcriptions. The amount of available high-quality training data and the cost of producing more of it is currently the main bottleneck in the development of automatic speech recognition systems. Another component in the improvement of automatic speech recognition systems are language models that capture semantic knowledge of a specific language. These require only textual data and can and have been trained on incomprehensible amounts of it. In this thesis we will investigate how language models can be more tightly integrated into the acoustic model training process to improve the overall system performance. Firstly, we consider sequence discriminative training of hybrid acoustic models. We propose a novel sequence discriminative training criterion that we call frame-level maximum mutual information. This is closely related to the state-level Bayes risk criterion but using it in model training should move them towards the true distribution instead of a sharp 0-1-distribution. While we do not see any improvements in word error rate, we do observe a qualitative change in the resulting probability distribution, which is less sharp if trained with the frame-level maximum mutual information criterion. Secondly, we propose to integrate language models into the training process of attention-based encoder-decoder acoustic models via log-linear combination. The sentence-level normalization of the combination gives rise to a sequence discriminative training criterion that we call maximum mutual information, based on its similarity to the equivalent training criterion for hybrid models. We investigate suitable approximations to the normalization term and the required search space size to capture all relevant contributions.The language model used in this combination is tuned extensively to show which properties are optimal for training integration. The new criterion is then compared to the existing expected error criterion and we show that competitive word error rates can be achieved. Thirdly, we aim to ameliorate the increased training time and complexity of the maximum mutual information criterion by using a symbol-level normalization. We show that the same improvement in word error rates can be achieved without significantly increasing the training time over the baseline. Additionally, we show that symbol-dependent scaling exponents, which are learned by back-propagation, can improve the word error rate.These improvements, however, go away once the acoustic model is jointly trained with the scales and language model. Lastly, we investigate the interplay of language model integration in acoustic model training and the internal language model correction approach. We find that most of the improvements of integrating a language model in the training process come from suppressing the implicit language model that is learned by the acoustic model decoder. We therefore show that the word error rate improvements obtained by integrating a language model in training are largely already captured when an internal language model correction model is used during recognition.
OpenAccess:
PDF
(additional files)
Dokumenttyp
Dissertation / PhD Thesis
Format
online
Sprache
English
Externe Identnummern
HBZ: HT031521541
Interne Identnummern
RWTH-2026-06051
Datensatz-ID: 1037447
Beteiligte Länder
Germany
|
The record appears in these collections: |