h1

h2

h3

h4

h5
h6
http://join2-wiki.gsi.de/foswiki/pub/Main/Artwork/join2_logo100x88.png

Robust appearance based sign language recognition = Robuste erscheinungsbasierte Gebärdenspracherkennung



Verantwortlichkeitsangabevorgelegt von Morteza Zahedi

ImpressumAachen : Publikationsserver der RWTH Aachen University 2007

Umfang118 S. : Ill., graph. Darst.


Aachen, Techn. Hochsch., Diss., 2007

Zsfassung in dt. und engl. Sprache


Genehmigende Fakultät
Fak01

Hauptberichter/Gutachter


Tag der mündlichen Prüfung/Habilitation
2007-09-21

Online
URN: urn:nbn:de:hbz:82-opus-20177
URL: https://publications.rwth-aachen.de/record/62481/files/Zahedi_Morteza.pdf

Einrichtungen

  1. Fachgruppe Informatik (120000)
  2. Lehrstuhl für Informatik 6 (Sprachverarbeitung und Mustererkennung) (122010)

Inhaltliche Beschreibung (Schlagwörter)
American sign language (Genormte SW) ; Deutsche Gebärdensprache (Genormte SW) ; Gebärdensprache (Genormte SW) ; British sign language (Genormte SW) ; Informatik (frei) ; American sign language recognition (frei) ; appearance-based (frei) ; gesture recognition (frei)

Thematische Einordnung (Klassifikation)
DDC: 004

Kurzfassung
In dieser Arbeit wird ein robustes, erscheinungsbasiertes Gebärdenspracherkennungssystem aufbauend auf einem Spracherkennungssystem für großes Vokabular vorgestellt. In diesem System werden viele Methoden aus der automatischen erarbeitung, um unterschiedliche Aspekte der Gebärden und der visuellen Unterschiede in der Erscheinung zu modellieren. Verschiedene Sachverhalte der erscheinungsbasierten Gebärdenspracherkennung, wie z.B. Datensammlungen, erscheinungsbasierte Merkmale, geometrische Merkmale, Training und Erkennung werden untersucht und analysiert.Außerdem wird der Stand der Forschung in der Gebärdensprach- und Gestenerkennung dargelegt. Im Gegensatz zum hier vorgestellten System bauen die meisten existierenden Ansätze auf spezielle Datenaufnahmetechniken, um die Gestendaten im Computer zu speichern. Systeme, die auf spezielle Datenaufnahmegeräte angewiesen sind, sind jedoch in praktischen Anwendungen oftmals nicht einsetzbar. Die Datensammlungen, die in den Systemen verwendet werden, sind oftmals von den publizierenden Gruppen erstellt worden und sind nicht öffentlich verfügbar, was es schwierig bzw. unmöglich macht, die Ergebnisse zu vergleichen. Um diese Defizite zu bewältigen, werden in unserem System nur Videodaten verwendentet, und die Evaluation findet ausschließlich auf öffentlich verfügbaren Datensammlungen statt. Um den Mangel an frei verfügbaren Daten zu reduzieren, und um auf unpraktische Datenaufnahmegeräte verzichten zu können, benutzen wir zunächst Videos aus öffentlich verfügbaren Quellen. Anschließend annotieren wir diese, um sie in unserem System zu trainieren und zu testen. Um die großen visuellen Variabilitäten der Gebärden in den Videobildern zu modellieren verwenden wir Aussprachevarianten, invariante Distanzfunktionen und unterschiedliche Merkmalsextraktions- und Reduktionsverfahren. Außerdem werden geometrische Merkmale, die die Handkonfiguration des Gebärdenden repräsentieren, benutzt, um die Genauigkeit des Erkennungssystems zu verbessern. Diese modellieren die Handposition, -orientierung und -konfiguration der dominanten Hand des Gebärdenden, die eine entscheidende Rolle für die Bedeutung einer Gebärde spielen. Schlussendlich wird beschrieben, wie die vorgestellten Methoden benutzt und zu einem robusten Gebärdenspracherkennungssystem mit einer hohen Erkennungsrate kombiniert werden können.

In this work, we introduce a robust appearance-based sign language recognition system which is derived from a large vocabulary speech recognition system. The system employs a large variety of methods known from automatic speech recognition research for the modeling of temporal and language specific issues. The feature extraction part of the system is based on recent developments in image processing which model different aspects of the signs and accounts for visual variabilities in appearance. Different issues of appearance-based sign language recognition such as datasets, appearance-based features, geometric features, training, and recognition parts are investigated and analyzed. We discuss the state of the art in sign language and gesture recognition. In contrast to the proposed system, most of the existing approaches use special data acquisition tools to collect the data of the signings. The systems which use this kind of data capturing tools are not useful in practical environments. Furthermore, the datasets created within their own group are not publicly available which makes it difficult to compare the results. To overcome these shortcomings and the problems of the existing approaches, our system is built to use video data only and evaluated on publicly available data. First, to overcome the scarceness of publicly available data and to remove the dependency on impractical data capturing devices, we use normal video files publicly available and create appropriate transcriptions of these files. Then, appearance-based features are extracted directly from the videos. To cope with the visual variability of the signs occurring in the image frames, pronunciation clustering, invariant distances, and different reduction methods are investigated. Furthermore, geometric features capturing the configuration of the signers' hand are investigated improving the accuracy of the recognition system. The geometric features represent the position, the orientation and the configuration of the signers' dominant hand which plays a major role to convey the meaning of the signs. Finally, it is described how to employ the introduced methods and how to combine the features to construct a robust sign language recognition system.

Fulltext:
Download fulltext PDF

Dokumenttyp
Dissertation / PhD Thesis

Format
online, print

Sprache
English

Externe Identnummern
HBZ: HT015334416

Interne Identnummern
RWTH-CONV-124047
Datensatz-ID: 62481

Beteiligte Länder
Germany

 GO


OpenAccess

QR Code for this record

The record appears in these collections:
Document types > Theses > Ph.D. Theses
Publication server / Open Access
Faculty of Computer Science (Fac.9)
Public records
Publications database
120000
122010

 Record created 2013-01-28, last modified 2022-04-22


Fulltext:
Download fulltext PDF
Rate this document:

Rate this document:
1
2
3
 
(Not yet reviewed)