h1

h2

h3

h4

h5
h6
http://join2-wiki.gsi.de/foswiki/pub/Main/Artwork/join2_logo100x88.png

Wissensbasierte Szenenanalyse für Navigationsaufgaben mobiler Roboter in Innenräumen = Knowledge based scene analysis for navigation tasks of mobile robots in indoor environments



Verantwortlichkeitsangabevorgelegt von Lars Libuda

Ausgabe1. Aufl.

ImpressumMünchen : Hut 2007

UmfangXVI, 216 S. : Ill., graph. Darst.


Aachen, Techn. Hochsch., Diss., 2006

Zsfassung in engl. und dt. Sprache


Genehmigende Fakultät
Fak06

Hauptberichter/Gutachter


Tag der mündlichen Prüfung/Habilitation
2006-12-21

Online
URN: urn:nbn:de:hbz:82-opus-17845
URL: https://publications.rwth-aachen.de/record/61656/files/Libuda_Lars.pdf

Einrichtungen

  1. Lehrstuhl und Institut für Mensch-Maschine-Interaktion (615210)

Inhaltliche Beschreibung (Schlagwörter)
Informatik (frei) ; Szenenanalyse (frei) ; Expertensystem (frei) ; Stereokamera (frei) ; Semantisches Netz (frei) ; Wissensverarbeitung (frei) ; Innenraum (frei) ; Fuzzy Sets (frei) ; scene analysis (frei) ; expert system (frei) ; semantic net (frei) ; fuzzy sets (frei) ; indoor environment (frei)

Thematische Einordnung (Klassifikation)
DDC: 004

Kurzfassung
Gegenstand der vorliegenden Arbeit ist die technische Realisierung eines Szenenanalysesystems, das die Erkennung mehrerer Objektkategorien unabhängig von deren visuellen Erscheinungsbild und die Generierung einer semantischen Beschreibung der mit Hilfe von Sensoren erfassten Szene vom Standpunkt des beobachtenden Systems zum Ziel hat. Diese ist eine notwendige Voraussetzung für die funktionale Navigation mobiler Roboter in Innenraumumgebungen sowie eine intuitive Mensch-Maschine-Interaktion. Die Grundlage für die Lösung des Problems bildet das Modell der menschlichen visuellen Perzeption nach Palmer, das eine Aufteilung des bei einer Szenenanalyse vom Menschen genutzten a priori Wissens auf vier Verarbeitungsstufen unterschiedlichen Abstraktionsgrades vom Szenenabbild bis zur semantischen Beschreibung sowie eine bidirektionale Verarbeitung dieser Stufen vorsieht. Zur Umsetzung dieses Modells wird ein neuartiges, modulares und anwendungsunabhängiges Verarbeitungskonzept entwickelt. Der Kern dieses Konzepts ist eine Wissensbasis, die auf einem semantischen Netz basiert, das um lokale Experten erweitert wird. Im Netz ist das deklarative Wissen in Form von Knoten und Kanten und in den in die Knoten eingebetteten lokalen Experten das zugehörige prozedurale Wissen kodiert. Dieses ist in Form von Regeln implementiert und für die Erzeugung von Ergebnissen, deren Bewertung sowie die Adaptation der Ergebniserzeugung zuständig. Eine Inferenzmaschine übernimmt die Verarbeitung der Wissensbasis, wobei das semantische Netz in eine serielle Abfolge der Knoten überführt wird und gemäß dieser Abfolge die lokalen Experten in die Inferenzmaschine eingebunden und deren Regeln ausgeführt werden. Die Verarbeitung erfolgt wie im Modell von Palmer bidirektional, bei der zwischen einer datengetriebenen Phase zur Ergebniserzeugung und einer modellgetriebenen Phase zur Ergebnisbewertung und Adaptation der Ergebniserzeugung differenziert wird. In beiden Phasen ist über eine Blackboardarchitektur ein Zugriff auf alle bis zu diesem Zeitpunkt erzeugten Ergebnisse möglich, um bereits vorhandenes Wissen zu nutzen. Die Dauer der Verarbeitung ist letztlich ausschließlich von den durch die lokalen Experten vorgenommenen Adaptationen abhängig. Basierend auf diesem Verarbeitungskonzept erfolgt die Entwicklung einer anwendungsspezifischen Wissensbasis für eine Innenraumszenenanalyse zur Erkennung der Objektkategorien Boden, Wand, Decke, Hindernis und Tür, die hauptsächlich Wissen über die Relationen der zu erkennenden Objektkategorien zueinander und zu einer Stereokamera enthält, die in dieser Anwendung der einzige Sensor ist. Dieses Wissen ist in den lokalen Experten der höchsten Verarbeitungsstufe nach Palmers Modell mit Hilfe von Fuzzy-Sets und Fuzzy-Logik umgesetzt. Die Bewertung des entwickelten Systems erfolgt anhand der Korrektheit des verwendeten a priori Wissens und dessen Robustheit gegenüber Störeinflüssen in den Sensordaten. Beide Kriterien werden erstmals im Forschungsbereich der Szenenanalyse getrennt voneinander und quantitativ erfasst. Die dafür notwendige Kontrollierbarkeit des Sensorrauschens wird durch den Einsatz einer VR-Umgebung erreicht. Der Vergleich der in der VR-Umgebung gewonnenen Ergebnisse mit manuell erstellen Referenzen zeigt, dass mit dem verwendeten a priori Wissen unter idealen Bedingungen 95% der Bildbereiche korrekt den zu erkennenden Objektkategorien zugeordnet werden. Damit wird nachgewiesen, dass das Modell von Palmer erfolgreich für die technische Realisierung von Szenenanalysesystemen einsetzbar ist.

This thesis is concerned with the technical realization of a scene analysis system which is able to recognize several object categories independent of their visual appearance and to generate a semantic description of the sensed scene from the sensor's point of view. This kind of scene analysis system is a necessary prerequisite for a functional driven navigation of mobile robots in indoor environments and an intuitive man-machine-interaction. The solution of the above mentioned problem is founded on the model of human visual perception introduced by Palmer which describes the human scene analysis by four processing layers with increasing level of abstraction from the retinal image to the semantic scene description and a bidirectional processing of these layers. Each layer contains local a priori knowledge which humans apply during scene analysis. For implementation of Palmer's model a new, modular, and application independent processing concept is developed. The core of this concept is a knowledge base, which consists of a semantic net extended by local experts. The declarative a priori knowledge of all processing layers is coded in the vertices and edges of the semantic net while the local experts which are embedded in the vertices contain the procedural a priori knowledge. The latter is represented in terms of production rules which are responsible for creating local results, rating these results, and adapting the creation of results. An inference engine processes the knowledge base by transforming the semantic net into a sequence of its vertices and by executing the rules of each local expert in the order of the created sequence. As required by Palmer's model the generated sequence of vertices is processed bidirectionally. Therefore a data driven processing phase for creating results and a model driven processing phase for rating these results and adapting the creation of results is distinguished. At each point in time a blackboard architecture allows to access all intermediate results. Therefore the system is able to use already gained knowledge, especially for adaptations. The time needed for a scene analysis finally depends only on the number of adaptations triggered by the local experts. Based on this processing concept an application dependent knowledge base for an indoor scene analysis for the recognition of floors, walls, ceilings, obstacles and doors is developed which mainly takes into account knowledge about the relations between these object categories to one another and to a stereo camera which is the only sensor in this application. This knowledge is coded in the local experts of the highest processing layer according to Palmer's model by means of Fuzzy sets and Fuzzy logic. The evaluation of the indoor scene analysis is based on the correctness of the used a priori knowledge and its robustness against noisy and incomplete sensor data. Both criteria are assessed quantitatively and independently of each other. Therefore control over the sensor noise is required which is guaranteed by the use of a virtual reality environment. The comparison of the scene analysis results obtained in the VR environment to manually created references shows that under ideal conditions the used a priori knowledge allows to assign 95% of the scene image regions to the object categories correctly. This finally leads to the conclusion that Palmer's model is suitable for technical realizations of scene analysis systems.

Fulltext:
Download fulltext PDF
(additional files)

Dokumenttyp
Dissertation / PhD Thesis

Format
online, print

Sprache
German

Externe Identnummern
HBZ: HT015007072

Interne Identnummern
RWTH-CONV-123295
Datensatz-ID: 61656

Beteiligte Länder
Germany

 GO


OpenAccess

QR Code for this record

The record appears in these collections:
Document types > Theses > Ph.D. Theses
Faculty of Electrical Engineering and Information Technology (Fac.6)
Publication server / Open Access
Public records
Publications database
615210

 Record created 2013-01-28, last modified 2026-05-28


Rate this document:

Rate this document:
1
2
3
 
(Not yet reviewed)