h1

h2

h3

h4

h5
h6
http://join2-wiki.gsi.de/foswiki/pub/Main/Artwork/join2_logo100x88.png

On data and knowledge transfer efficiency in deep learning = Über die Effizienz von Daten- und Wissenstransfer im Deep Learning



Verantwortlichkeitsangabevorgelegt von Alessio Quercia, M. Sc.

ImpressumAachen : RWTH Aachen University 2025

Umfang1 Online-Ressource : Illustrationen


Dissertation, RWTH Aachen University, 2025

Veröffentlicht auf dem Publikationsserver der RWTH Aachen University 2026


Genehmigende Fakultät
Fak09

Hauptberichter/Gutachter
; ;

Tag der mündlichen Prüfung/Habilitation
2025-12-05

Online
DOI: 10.18154/RWTH-2025-10885
URL: https://publications.rwth-aachen.de/record/1023964/files/1023964.pdf

Einrichtungen

  1. Lehr- und Forschungsgebiet Neural Computation (FZ Jülich) (124920)

Thematische Einordnung (Klassifikation)
DDC: 004

Kurzfassung
Deep Learning (DL) hat rasanten Fortschritt erlebt, der durch die Entwicklung immer größerer Modelle und Datensätze gekennzeichnet ist. Dieser Trend wird von der Annahme getrieben, dass größere Modelle bessere Leistung bringen. Doch das Streben nach größeren Modellen und Datensätzen hat Überlegungen zur Energieeffizienz in den Hintergrund gedrängt und zu einem Wettlauf geführt, bei dem sekundäre Faktoren wie die Umweltbelastung vernachlässigt werden. Es laufen Bestrebungen, diese Energieineffizienzen zu adressieren. Diese Arbeit stellt neuartige, daten- und wissensübertragungseffiziente Trainingsverfahren vor, die die durch das Hochskalieren von Modellen und Datensätzen in Computer Vision-Anwendungen eingeführten Energieineffizienzen verringern. Insbesondere stellen wir eine dateneffiziente Methode vor, die SGD auf Stichproben ausrichtet, die nach wenigen Trainingsrunden als wichtiger erachtet werden. Im Vergleich zu aktuellen Methoden benötigt unsere Methode keinen zusätzlichen Overhead zur Schätzung der Stichprobenwichtigkeit. Außerdem erweitern wir sie auf die Super-Auflösung von Computertomographie-Scans (CT-Scans), die mit niedriger Auflösung aufgenommen werden, um Patienten vor hoher Strahlung zu schützen und Kosten zu senken. Die superaufgelösten CT-Bilder können anschließend verwendet werden, um den Fluss in der Nasenhöhle durch Simulationen vorherzusagen. Wir untersuchen Möglichkeiten, Wissen effizient zwischen ähnlichen Bildverarbeitungsaufgaben zu übertragen und wiederzuverwenden. Wir schlagen ein alternierendes Trainingsverfahren vor, das Hilfsdatensätze nicht-MDE-bezogener verwandter Bildverarbeitungsaufgaben nutzt, um die MDE-Downstream-Aufgabe zu verbessern. Dies steigert die MDE-Leistung, indem MDE-Schritte stärker gewichtet werden als Hilfsschritte. Zuletzt stellen wir ILoRA (Feature-Integral Low-Rank Adaptation) vor, eine rechen-, parameter- und speichereffiziente Fine-Tuning-Methode, die das Feature-Integral als feste Kompression und einen einzigen trainierbaren Vektor als Dekompression verwendet. Anders als aktuelle Methoden verwendet ILoRA pro Schicht weniger Parameter, wodurch der Speicherbedarf und die Rechenkosten reduziert werden. Einerseits zeigt diese Arbeit, dass es möglich ist, die Abhängigkeit von großen Datensätzen durch sorgfältig entworfene dateneffiziente Verfahren zu verringern, was zu schnellerem Modelltraining ohne Leistungseinbußen führt. Andererseits zeigt sie, dass Trainingsverfahren durch effiziente Wissenstransfer von vortrainierten Grundmodellen und durch zusätzliche Hilfsaufgaben gesteigert werden können. Insgesamt können effiziente Strategien zur Daten- und Wissenstransfer sowie Fortschritte in der Hardware die Energieineffizienzen beim Hochskalieren von Deep-Learning-Modellen und Datensätzen erheblich verringern. Indem wir diese Effizienzen priorisieren, können wir nachhaltige KI-Systeme entwickeln, die hohe Leistung mit minimalem Umweltimpact in Einklang bringen.

Deep Learning (DL) has seen rapid advancements, characterized by the development of increasingly larger models and datasets. This trend is driven by the belief that bigger models yield better performance. However, the pursuit of larger models and datasets has overshadowed considerations of energy efficiency, leading to a race where secondary factors, such as environmental impact, are neglected. Efforts are underway to address these energy inefficiencies. This work presents novel data and knowledge transfer efficient training procedures alleviating the energy inefficiencies introduced by the scaling up of models and datasets in Computer Vision applications. In particular, we introduce a data-efficient method that biases SGD towards samples that are found to be more important after a few training epochs. Compared to state-of-the-art methods, our method does not require any additional overhead to estimate sample importance. Moreover, we extend it to super-resolution of Computer Tomography (CT) scans, recorded at low resolution to avoid exposing patients to high radiation and to reduce the costs. The super-resolved CT images can then be used to predict the flow in the nasal cavity through simulations. We explore ways to efficiently transfer and re-use knowledge between similar vision tasks. We propose an alternating training scheme leveraging auxiliary non-MDE datasets from related vision tasks to boost the MDE downstream task. This improves the MDE performance by weighting MDE steps more than auxiliary ones. Lastly, we propose ILoRA (Feature-Integral Low-Rank Adaptation), a compute, parameter and memory efficient fine-tuning method which uses the feature integral as fixed compression and a single trainable vector as decompression. Differently from state-of-the-art methods, ILoRA uses fewer parameters per layer, reducing the memory footprint and the computational cost. On one hand, this work shows that it is possible to reduce the reliance on big datasets by using carefully designed data efficient procedures, resulting in faster model training with no performance drop. On the other hand, it shows that training procedures can be boosted by efficiently transferring knowledge from pre-trained foundation models and by using additional auxiliary tasks. Overall, efficient data and knowledge transfer strategies, alongside advancements in hardware, can significantly reduce the energy inefficiencies of scaling deep learning models and datasets. By prioritizing these efficiencies, we can develop sustainable AI systems that balance high performance with minimal environmental impact.

OpenAccess:
Download fulltext PDF
(additional files)

Dokumenttyp
Dissertation / PhD Thesis

Format
online

Sprache
English

Externe Identnummern
HBZ: HT031363765

Interne Identnummern
RWTH-2025-10885
Datensatz-ID: 1023964

Beteiligte Länder
Germany

 GO


OpenAccess

QR Code for this record

The record appears in these collections:
Document types > Theses > Ph.D. Theses
Publication server / Open Access
Faculty of Computer Science (Fac.9)
Public records
Publications database
124920

 Record created 2025-12-17, last modified 2026-08-12


OpenAccess:
Download fulltext PDF
(additional files)
Rate this document:

Rate this document:
1
2
3
 
(Not yet reviewed)