2026
Dissertation, RWTH Aachen University, 2026
Veröffentlicht auf dem Publikationsserver der RWTH Aachen University
Genehmigende Fakultät
Fak09
Hauptberichter/Gutachter
; ;
Tag der mündlichen Prüfung/Habilitation
2026-07-06
Online
DOI: 10.18154/RWTH-2026-07674
URL: https://publications.rwth-aachen.de/record/1040079/files/1040079.pdf
Einrichtungen
Inhaltliche Beschreibung (Schlagwörter)
HPC cluster (frei) ; TCO (frei) ; energy (frei) ; power (frei) ; productivity (frei)
Thematische Einordnung (Klassifikation)
DDC: 004
Kurzfassung
Der Bedarf an Rechenleistung in der traditionellen wissenschaftlichen Datenverarbeitung sowie im Bereich der künstlichen Intelligenz ist in den vergangenen Jahren kontinuierlich gestiegen. Infolgedessen haben Hochleistungsrechner (High-Performance Computing, HPC) hinsichtlich ihrer Größe und ihres Energieverbrauchs über die letzten Jahrzehnte erheblich zugenommen, wie historische TOP500-Daten belegen. In den vergangenen zwanzig Jahren hat sich die Rechenleistung des jeweils leistungsstärksten TOP500-Systems um den Faktor 60 erhöht, während sich dessen Leistungsaufnahme nahezu verdoppelt hat. Gegenwärtige und zukünftige großskalige HPC-Systeme stoßen an eine Leistungsgrenze („Power Wall“), die durch die begrenzte Kapazität der unterstützenden Infrastruktur sowie steigende Energiekosten verursacht wird. Daher gewinnt ein effizientes Management und eine gezielte Optimierung des Energieverbrauchs von HPC-Clustern zunehmend an Bedeutung, um Infrastrukturengpässe zu entschärfen und den Energieverbrauch zu reduzieren. In dieser Arbeit untersuche ich die gesamten Kosten TTotal Cost of Ownership"(TCO) eines HPC-Systems, die in einmalige und jährliche Kosten aufgeteilt sind. Die einmaligen Kosten umfassen die Investition in Infrastruktur und Rechenknoten, während die jährlichen Kosten die Stromkosten beinhalten. Die Daten von zwei HPC-Systemen aus Deutschland zeigen, dass die Leistungsaufnahme ein hohen Kostenanteil verursacht. Deswegen entwickele ich Energieverwaltungsstrategien, um diese Kosten zu reduzieren. Allerdings haben solche Strategien Nebenwirkungen auf die Rechenleistung, da die Rechenknoten oft gedrosselt werden müssen. Dafür definiere ich Produktivität, um diesen Konflikt zu lösen. Während der Konstruktion eines Systems definiere ich Produktivität als die Anzahl der angeschafften Knoten in Relation zu der gesamten Investition. Durch eine verbesserte Beschaffungsstrategie, im Hinblick auf die gesamte Infrastruktur als auch auf die spezifische Investition eines HPC-Systems, kann die Produktivität verbessert werden. In diesem Fall untersuche ich Strategien, die die aktuelle Leistungsaufnahme des Systems unter einem bestimmten Grenzwert senken. Im Kontext des Betriebs eines HPC-Systems definiere ich Produktivität als die Anzahl der ausgeführten Rechenjobs zum TCO. Im Weiteren reduziere ich den Energieverbrauch, um Energiekosten zu sparen. Gleichzeitig maximiere ich den Jobdurchsatz des Systems. Damit kann die Produktivität erhöht werden. Die zwei Fälle der Optimierung benötigen anspruchsvolles Management der Leistungsaufnahme, das das System aus zahlreichen Rechenknoten besteht und viele verschiedene Rechenjobs ausführt. Ich entwickele eine strukturierte Lösung, die aus Cluster, Job und Knoten Management besteht. Ein Cluster Manager verwaltet den Stromverbrauch des ganzen Clusters und verteilt das Strombudget zu Jobs und Rechenknoten. Ein Jobmanager steuert den Stromverbrauch eines individuellen Jobs und der darunter verwendeten Knoten. Ein Knoten Manager optimiert den Verbrauch der Hardware des Knotens. Für jeden Manager untersuche ich Strategien, um den Stromverbrauch zu reduzieren sowie die Leistungsaufnahme zu begrenzen. Zum Schluss bewerte ich die entwickelten Managementstrategien mit den Produktivitätsmodellen gegenüber Daten aus realen Clustern. Die entwickelten Strategien reduzieren die Gesamtkosten und verbessern damit die Produktivität.The demand for computational power in both traditional scientific computing and artificial intelligence has continued to increase. Consequently, high-performance computing (HPC) clusters have grown in both size and power dissipation over the past several decades, as evidenced by historical TOP500 records. Over the past twenty years, the computational performance of the flagship TOP500 system has increased by a factor of 60, while its power consumption has nearly doubled. Current and future large-scale HPC clusters face a power wall imposed by the limited capacity of supporting infrastructure and rising energy costs. Therefore, effectively managing and optimizing cluster power consumption has become increasingly important to alleviate infrastructure constraints and reduce energy consumption. In this thesis, first, I discuss a cluster’s total costs of ownership (TCO) by covering one-time and annual costs. The one-time costs arise in a cluster construction stage through investments into infrastructure and compute nodes. In contrast, the annual costs arise from the electricity bill, et cetera. Based on TCO data collected from two real-world clusters in Germany, the costs related to power have a considerable TCO share. Next, I introduce advanced power management to reduce the TCO. However, such management comes with side effects on the clusters’ computational performance due to the throttling of underlying hardware. Therefore, I define cluster productivity to investigate the trade-offs between power and performance. At the cluster construction stage, I define productivity as the amount of installed compute nodes to the total investment. I optimize productivity through improved financial budgeting into the cluster and infrastructures. In this case, I introduce strategies to manage the cluster’s actual power dissipation to remain under a certain power limitation. During the cluster’s operation, I define productivity as the amount of executed user jobs to the TCO. I showcase approaches for reducing energy consumption and costs. Additionally, I present techniques that maximize the job throughput. In order to efficiently manage the power consumption of a large-scale cluster in the above two cases, complex and portable approaches are required to fulfil the requirements of a large number of nodes and diverse running jobs. To tackle these challenges, I introduce a management hierarchy consisting of cluster-wide, job-level, and node-level agents. The cluster agent controls the power management of the entire cluster. It distributes power budgets to running jobs and compute nodes. The job agent regulates the power setting of nodes employed by a job. The node agent manages the power dissipation of distinct hardware components. For each agent, I explore approaches to reduce energy consumption and maintain a power cap, respectively. Finally, I evaluate diverse power-management approaches using productivity models and real-world data. The management is validated to be effective where the TCO is reduced and the productivity is improved.
OpenAccess:
PDF
(additional files)
Dokumenttyp
Dissertation / PhD Thesis
Format
online
Sprache
English
Externe Identnummern
HBZ: HT031566421
Interne Identnummern
RWTH-2026-07674
Datensatz-ID: 1040079
Beteiligte Länder
Germany
|
The record appears in these collections: |