h1

h2

h3

h4

h5
h6
http://join2-wiki.gsi.de/foswiki/pub/Main/Artwork/join2_logo100x88.png

Hierarchical power and energy management of high-performance computing systems for total cost of ownership optimization



Verantwortlichkeitsangabevorgelegt von Bo Wang, Master of Science

ImpressumAachen : RWTH Aachen University 2026

Umfang1 Online-Ressource : Illustrationen


Dissertation, RWTH Aachen University, 2026

Veröffentlicht auf dem Publikationsserver der RWTH Aachen University


Genehmigende Fakultät
Fak09

Hauptberichter/Gutachter
; ;

Tag der mündlichen Prüfung/Habilitation
2026-07-06

Online
DOI: 10.18154/RWTH-2026-07674
URL: https://publications.rwth-aachen.de/record/1040079/files/1040079.pdf

Einrichtungen

  1. Lehrstuhl für Hochleistungsrechnen (Informatik 12) (123010)

Inhaltliche Beschreibung (Schlagwörter)
HPC cluster (frei) ; TCO (frei) ; energy (frei) ; power (frei) ; productivity (frei)

Thematische Einordnung (Klassifikation)
DDC: 004

Kurzfassung
Der Bedarf an Rechenleistung in der traditionellen wissenschaftlichen Datenverarbeitung sowie im Bereich der künstlichen Intelligenz ist in den vergangenen Jahren kontinuierlich gestiegen. Infolgedessen haben Hochleistungsrechner (High-Performance Computing, HPC) hinsichtlich ihrer Größe und ihres Energieverbrauchs über die letzten Jahrzehnte erheblich zugenommen, wie historische TOP500-Daten belegen. In den vergangenen zwanzig Jahren hat sich die Rechenleistung des jeweils leistungsstärksten TOP500-Systems um den Faktor 60 erhöht, während sich dessen Leistungsaufnahme nahezu verdoppelt hat. Gegenwärtige und zukünftige großskalige HPC-Systeme stoßen an eine Leistungsgrenze („Power Wall“), die durch die begrenzte Kapazität der unterstützenden Infrastruktur sowie steigende Energiekosten verursacht wird. Daher gewinnt ein effizientes Management und eine gezielte Optimierung des Energieverbrauchs von HPC-Clustern zunehmend an Bedeutung, um Infrastrukturengpässe zu entschärfen und den Energieverbrauch zu reduzieren. In dieser Arbeit untersuche ich die gesamten Kosten TTotal Cost of Ownership"(TCO) eines HPC-Systems, die in einmalige und jährliche Kosten aufgeteilt sind. Die einmaligen Kosten umfassen die Investition in Infrastruktur und Rechenknoten, während die jährlichen Kosten die Stromkosten beinhalten. Die Daten von zwei HPC-Systemen aus Deutschland zeigen, dass die Leistungsaufnahme ein hohen Kostenanteil verursacht. Deswegen entwickele ich Energieverwaltungsstrategien, um diese Kosten zu reduzieren. Allerdings haben solche Strategien Nebenwirkungen auf die Rechenleistung, da die Rechenknoten oft gedrosselt werden müssen. Dafür definiere ich Produktivität, um diesen Konflikt zu lösen. Während der Konstruktion eines Systems definiere ich Produktivität als die Anzahl der angeschafften Knoten in Relation zu der gesamten Investition. Durch eine verbesserte Beschaffungsstrategie, im Hinblick auf die gesamte Infrastruktur als auch auf die spezifische Investition eines HPC-Systems, kann die Produktivität verbessert werden. In diesem Fall untersuche ich Strategien, die die aktuelle Leistungsaufnahme des Systems unter einem bestimmten Grenzwert senken. Im Kontext des Betriebs eines HPC-Systems definiere ich Produktivität als die Anzahl der ausgeführten Rechenjobs zum TCO. Im Weiteren reduziere ich den Energieverbrauch, um Energiekosten zu sparen. Gleichzeitig maximiere ich den Jobdurchsatz des Systems. Damit kann die Produktivität erhöht werden. Die zwei Fälle der Optimierung benötigen anspruchsvolles Management der Leistungsaufnahme, das das System aus zahlreichen Rechenknoten besteht und viele verschiedene Rechenjobs ausführt. Ich entwickele eine strukturierte Lösung, die aus Cluster, Job und Knoten Management besteht. Ein Cluster Manager verwaltet den Stromverbrauch des ganzen Clusters und verteilt das Strombudget zu Jobs und Rechenknoten. Ein Jobmanager steuert den Stromverbrauch eines individuellen Jobs und der darunter verwendeten Knoten. Ein Knoten Manager optimiert den Verbrauch der Hardware des Knotens. Für jeden Manager untersuche ich Strategien, um den Stromverbrauch zu reduzieren sowie die Leistungsaufnahme zu begrenzen. Zum Schluss bewerte ich die entwickelten Managementstrategien mit den Produktivitätsmodellen gegenüber Daten aus realen Clustern. Die entwickelten Strategien reduzieren die Gesamtkosten und verbessern damit die Produktivität.

The demand for computational power in both traditional scientific computing and artificial intelligence has continued to increase. Consequently, high-performance computing (HPC) clusters have grown in both size and power dissipation over the past several decades, as evidenced by historical TOP500 records. Over the past twenty years, the computational performance of the flagship TOP500 system has increased by a factor of 60, while its power consumption has nearly doubled. Current and future large-scale HPC clusters face a power wall imposed by the limited capacity of supporting infrastructure and rising energy costs. Therefore, effectively managing and optimizing cluster power consumption has become increasingly important to alleviate infrastructure constraints and reduce energy consumption. In this thesis, first, I discuss a cluster’s total costs of ownership (TCO) by covering one-time and annual costs. The one-time costs arise in a cluster construction stage through investments into infrastructure and compute nodes. In contrast, the annual costs arise from the electricity bill, et cetera. Based on TCO data collected from two real-world clusters in Germany, the costs related to power have a considerable TCO share. Next, I introduce advanced power management to reduce the TCO. However, such management comes with side effects on the clusters’ computational performance due to the throttling of underlying hardware. Therefore, I define cluster productivity to investigate the trade-offs between power and performance. At the cluster construction stage, I define productivity as the amount of installed compute nodes to the total investment. I optimize productivity through improved financial budgeting into the cluster and infrastructures. In this case, I introduce strategies to manage the cluster’s actual power dissipation to remain under a certain power limitation. During the cluster’s operation, I define productivity as the amount of executed user jobs to the TCO. I showcase approaches for reducing energy consumption and costs. Additionally, I present techniques that maximize the job throughput. In order to efficiently manage the power consumption of a large-scale cluster in the above two cases, complex and portable approaches are required to fulfil the requirements of a large number of nodes and diverse running jobs. To tackle these challenges, I introduce a management hierarchy consisting of cluster-wide, job-level, and node-level agents. The cluster agent controls the power management of the entire cluster. It distributes power budgets to running jobs and compute nodes. The job agent regulates the power setting of nodes employed by a job. The node agent manages the power dissipation of distinct hardware components. For each agent, I explore approaches to reduce energy consumption and maintain a power cap, respectively. Finally, I evaluate diverse power-management approaches using productivity models and real-world data. The management is validated to be effective where the TCO is reduced and the productivity is improved.

OpenAccess:
Download fulltext PDF
(additional files)

Dokumenttyp
Dissertation / PhD Thesis

Format
online

Sprache
English

Externe Identnummern
HBZ: HT031566421

Interne Identnummern
RWTH-2026-07674
Datensatz-ID: 1040079

Beteiligte Länder
Germany

 GO


OpenAccess

QR Code for this record

The record appears in these collections:
Document types > Theses > Ph.D. Theses
Publication server / Open Access
Faculty of Computer Science (Fac.9)
Public records
Publications database
123010

 Record created 2026-08-11, last modified 2026-09-10


OpenAccess:
Download fulltext PDF
(additional files)
Rate this document:

Rate this document:
1
2
3
 
(Not yet reviewed)