Das Suchergebnis hat sich seit Ihrer Suchanfrage verändert. Eventuell werden Dokumente in anderer Reihenfolge angezeigt.
  • Treffer 10 von 189
Zurück zur Trefferliste

Performance analysis and optimization of highly diverging algorithms on GPUs

  • In this thesis, the performance of the IceCube projects photon propagation code (clsim) is optimized. The process of GPU code analysis and perfor- mance optimization is described in detail. When run on the same hard- ware, the new version achieves a speedup of about 3x over the original implementation. Comparing the unmodified code on hardware currently used by IceCube (NVIDIA GTX 1080) against the optimized version run on a recent GPU (NVIDIA A100) a speedup of about 9.23x is observed. All changes made to the code are shown and their performance impact as well as the implications for simulation accuracy are discussed individually. The approach taken for optimization is then generalized into a recipe. Programmers can use it as a guide, when approaching large and complex GPU programs. In addition, the per warp job-queue, a design pattern used for load balancing among threads in a CUDA thread block, is discussed in detail.
  • In dieser Arbeit wird die Geschwindigkeit des Simulationscodes zur Pho- tonenausbreitung beim IceCube-Projekt (clsim) optimiert. Der Prozess der GPU-Code-Analyse und Leistungsoptimierung wird im Detail beschrie- ben. Wenn beide Codes auf der gleichen Hardware ausgeführt werden, wird ein Speedup von etwa 3x gegenüber der ursprünglichen Implemen- tierung erreicht. Vergleicht man den unveränderten Code auf der derzeit von IceCube verwendeten Hardware (NVIDIA GTX 1080) mit der opti- mierten Version, die auf einer aktuellen GPU (NVIDIA A100) läuft, wird ein Speedup von etwa 9,23x beobachtet. Alle Änderungen am Code wer- den vorgestellt und deren Auswirkung auf die Laufzeit und Genauigkeit der Simulation diskutiert. Der für die Optimierung verfolgte Weg wird dann in einem Schema verallgemeinert. Programmierer können es als Leitfaden nutzen, um große und komplexe GPU-Programme zu optimieren. Darüber hinaus wird die per warp job-queue, ein Entwurfsmuster für das load balancing innerhalb eines CUDA-Thread-Blocks, im Detail besprochen.

Volltext Dateien herunterladen

Metadaten exportieren

Metadaten
Verfasserangaben:Hendrik Schwanekamp
URN:urn:nbn:de:kola-21617
Betreuer:Stefan Müller, Peter Messmer
Dokumentart:Masterarbeit
Sprache:Englisch
Datum der Fertigstellung:23.02.2021
Datum der Veröffentlichung:21.04.2021
Veröffentlichende Institution:Universität Koblenz, Universitätsbibliothek
Titel verleihende Institution:Universität Koblenz, Fachbereich 4
Datum der Abschlussprüfung:18.03.2021
Datum der Freischaltung:21.04.2021
Freies Schlagwort / Tag:GPU; IceCube; Neutino; performance optimization; warp divergence
Seitenzahl:v, 48
Institute:Fachbereich 4 / Institut für Computervisualistik
DDC-Klassifikation:0 Informatik, Informationswissenschaft, allgemeine Werke / 00 Informatik, Wissen, Systeme / 005 Computerprogrammierung, Programme, Daten
Lizenz (Deutsch):License LogoEs gilt das deutsche Urheberrecht: § 53 UrhG