2024
Dissertation, RWTH Aachen University, 2024
Veröffentlicht auf dem Publikationsserver der RWTH Aachen University
Genehmigende Fakultät
Fak01
Hauptberichter/Gutachter
;
Tag der mündlichen Prüfung/Habilitation
2024-05-24
Online
DOI: 10.18154/RWTH-2024-06779
URL: https://publications.rwth-aachen.de/record/989404/files/989404.pdf
Einrichtungen
Projekte
Inhaltliche Beschreibung (Schlagwörter)
computer vision (frei) ; deep learning (frei) ; interactive segmentation (frei) ; machine learning (frei) ; object segmentation (frei) ; video object segmentation (frei)
Thematische Einordnung (Klassifikation)
DDC: 004
Kurzfassung
Die Segmentierung ist eine wichtige Aufgabe in der Computer Vision, bei der die zu einer Region von Interesse gehörenden Pixel, die oft ähnliche Merkmale aufweisen, herausgefiltert und mit einem eindeutigen Label versehen werden müssen. Diese Aufgabe ist sowohl im Bild- als auch im Videobereich relevant und findet direkte Anwendungen in einer Vielzahl von Bereichen, einschließlich, aber nicht beschränkt auf autonomes Fahren, Robotik, Bildbearbeitung und Überwachung. Sowohl bei Bildern als auch bei Videos gibt es verschiedene Arten der Segmentierung, die oft eng miteinander verbunden und gleichermaßen anspruchsvoll sind. Mit dem Aufkommen des Deep Learning sind moderne Computer-Vision-Algorithmen in der Lage, große Mengen verfügbarer Daten zu nutzen, um bei vielen dieser Segmentierungsprobleme eine beeindruckende Leistung zu erzielen. Allerdings sind solche Algorithmen oft entweder auf die Segmentierung eines vordefinierten Satzes von Objektkategorien oder auf bestimmte Teilbereiche ausgerichtet und müssen für Aufgaben außerhalb des Bereichs angepasst werden, indem diese Methoden auf zusätzlichen bereichsspezifischen Daten trainiert werden, deren Annotation teuer ist. Daher benötigen wir Algorithmen, die sich gut auf Daten aus unbekannten Domänen und auf neue Aufgabenstellungen verallgemeinern lassen, sowie Methoden, die Daten effizient annotieren können. In dieser Arbeit konzentrieren wir uns auf drei Teilprobleme der Segmentierung: (i) Interaktive Segmentierung, bei der das Ziel darin besteht, Objekte in einem Bild mithilfe von Benutzerklicks zu segmentieren und zu verfeinern, (ii) Segmentierung von hervorstechenden Regionen in Videos, bei der das Ziel darin besteht, die hervorstechende Region in einem gegebenen Video automatisch zu erkennen und zu segmentieren, und (iii) Instanzsegmentierung in Videos, bei der das Ziel darin besteht, einzelne Objektinstanzen in einem gegebenen Video automatisch zu erkennen, zu segmentieren und zu verfolgen. Der erste Teil dieser Arbeit konzentriert sich auf die interaktive Segmentierung mit Hilfe von Benutzerklicks und diskutiert unsere zwei neuartigen interaktiven Segmentierungsarchitekturen. Unsere erste Methode schlägt eine iterative Trainingsstrategie vor, bei der die Klicks während des Trainings iterativ hinzugefügt werden, basierend auf den Fehlerregionen in den Netzwerkvorhersagen. Die iterative Trainingsstrategie gleicht die simulierten Benutzer-Klickmuster, die während des Trainings verwendet werden, mit den tatsächlichen Klickmustern ab, auf die das Netzwerk zur Testzeit treffen würde. In unserer zweiten Arbeit zur interaktiven Segmentierung formulieren wir die Benutzerklicks als räumlich-zeitliche Sequenzen und entwickeln eine neuartige, auf Transformer basierende Formulierung, die eine solche Sequenz verarbeiten und in relevante Objekt- oder Regionsdeskriptoren kodieren kann. Diese Deskriptoren werden dann verwendet, um die relevanten Instanzsegmentierungsmasken zu generieren. Im Gegensatz zu früheren Methoden kann unsere Architektur Klicks für mehrere Objekte auf einmal verarbeiten und dementsprechend nicht überlappende Segmentierungsmasken ohne Nachbearbeitung vorhersagen. Wir entwickeln auch eine neue interaktive Segmentierungsaufgabe mit mehreren Instanzen und einen entsprechenden Benchmark und zeigen empirisch die Wirksamkeit unserer Methode, indem wir sie evaluieren. Im letzten Teil dieser Arbeit konzentrieren wir uns auf End-to-End Videosegmentierungsnetzwerke auf der Grundlage von 3D-Faltungen. Die erste Methode in diesem Teil stellt ein effizientes 3D-Encoder-Decoder-Netzwerk vor, das auffällige Regionen in einem gegebenen Video automatisch segmentieren kann. Inspiriert von der Handlungserkennungs-Community verwenden wir einen effizienten 3D-Encoder, der auf einem großen Korpus von Handlungserkennungsdaten vortrainiert ist, um den zeitlichen Kontext zu erfassen und dementsprechend Erscheinungsbild und Bewegungsinformationen gemeinsam zu kodieren. Diese kodierten Merkmale werden dann von unserem neuartigen 3D-Decoder verwendet, um auffällige Regionen direkt zu segmentieren, ohne dass zusätzliche Netzwerke oder heuristische Nachbearbeitungen erforderlich sind. Da es für praktische Anwendungen viel nützlicher ist, die Objektinstanzen zusätzlich zur automatischen Erkennung auffälliger Regionen separat zu segmentieren, schlagen wir außerdem einen Bottom-up-End-to-End-Ansatz für die Instanzsegmentierung in Videos vor. Zu diesem Zweck verwenden wir ein partielles 3D-Netzwerk, um räumlich-zeitliche Einbettungen zu lernen, die auf der Grundlage der vorhergesagten Clustering-Parameter in Instanzröhren geclustert werden können. Unsere Methode ist sehr generisch und kann auf eine Vielzahl von Instanzsegmentierungsaufgaben in Videos angewendet werden. Inspiriert von 2D deformierbaren und dilatierten Faltungen, schlagen wir in unserer letzten Arbeit eine 3D-Variante der dilatierten Faltung vor, die einen unabhängigen multiplikativen Faktor entlang jeder der drei Dimensionen lernt, der dann zur Dilatation eines 3D-Kernels verwendet werden kann. Unsere 3D-Dilatationsfaltung verbessert die Leistung von 3D-Faltungsnetzen für eine Vielzahl von Segmentierungsaufgaben in Videos durch das Erlernen besserer 3D-Darstellungen.Segmentation is an important task in computer vision where the pixels belonging to a region of interest, that often share similar characteristics, have to be separated out and assigned a unique label. This task is relevant in both the image and video domains, and finds direct applications in a wide range of fields including but not limited to autonomous driving, robotics, image editing, and surveillance. For both images and videos, the task of segmentation has various flavours that are often highly related and equally challenging. With the advent of deep learning, modern computer vision algorithms are able to leverage large amounts of available data to achieve impressive performance for many of these segmentation problems. However, such algorithms are often catered either towards segmenting a pre-defined set of object categories, or to some specific sub-domains, and require to be adapted for out-of-domain tasks by training these methods on additional domain-specific data, that is expensive to annotate. As a result, we need algorithms that generalise well to data from unseen domains and also to new task settings in addition to having methods that can efficiently annotate data. In this thesis, we focus on three segmentation sub-problems: (i) Interactive Segmentation, where the goal is to segment and refine objects in an image using user clicks, (ii) Salient Region Segmentation on Videos, where the goal is to automatically detect and segment the salient region in a given a video, and (iii) Instance Segmentation on Videos, where the goal is to automatically detect, segment and track individual object instances in the given video. The first part of this thesis focuses on Interactive Segmentation using user clicks and discusses our two novel Interactive Segmentation architectures. Our first method proposes an iterative training strategy in which clicks are added iteratively during training based on the error regions in the network predictions. The iterative training strategy aligns the simulated user-click patterns that are used during training with the actual click patterns that the network would encounter at test time.In our second work on Interactive Segmentation, we formulate user clicks as spatio-temporal sequences, and develop a novel Transformer based formulation that can process such a sequence and encode them into relevant object or region descriptors. These descriptors are then used to generate the relevant instance segmentation masks. Unlike previous methods, our architecture can process clicks for multiple objects at once, and correspondingly predicts non-overlapping segmentation masks without any post-processing. We also develop a new multi-instance Interactive Segmentation task and a corresponding benchmark, and empirically show the efficacy of our method by evaluating on it. In the second part of this thesis, we focus on end-to-end video segmentation networks based on 3D convolutions. The first method in this part introduces an efficient 3D encoder-decoder network that can segment salient regions in the given video automatically. Inspired from the action recognition community, we employ an efficient 3D encoder that is pre-trained on a large corpus of action recognition data to capture temporal context, and correspondingly encode appearance and motion information jointly. These encoded features are then used by our novel 3D decoder to directly segment salient regions without using any additional networks or heuristic post-processing. Since it is much more useful for practical applications to separately segment the object instances in addition to automatically detecting salient regions, we further propose a bottom-up end-to-end approach for instance segmentation on videos. To this end, we use a partially 3D network to learn spatio-temporal embeddings that can be clustered into instance tubes based on the predicted clustering parameters. Our method is very generic and can be applied to a wide range of instance segmentation tasks in videos. Inspired from 2D deformable and dilated convolutions, in our final work, we propose a 3D variant of dilated convolutions which learns an independent multiplicative factor along each of the three dimensions, that can then be used to dilate a 3D kernel. Our 3D dilated convolution improves the performance of 3D convolution based networks for a variety of segmentation tasks in videos by learning better 3D representations.
OpenAccess:
PDF
(additional files)
Dokumenttyp
Dissertation / PhD Thesis
Format
online
Sprache
English
Externe Identnummern
HBZ: HT030845157
Interne Identnummern
RWTH-2024-06779
Datensatz-ID: 989404
Beteiligte Länder
Germany
|
The record appears in these collections: |