Übersicht
Worum es bei diesem Projekt geht.
Trainiere ein Sprachmodell mit DDP, FSDP und Pipeline-Parallel auf einem A100-Cluster, messe MFU und erhalte ein verifizierbares Zertifikat.
Das Szenario
Der Konzern (rund 38.000 Mitarbeitende, davon 600 in IT-Plattformen) hat im letzten Jahr 8 Mio. EUR in eine eigene GPU-Plattform investiert und will jetzt sicher sein, dass die Verteilungsstrategie nicht 30 % der Hardware verschwendet.
Das Briefing
Was Du tust und was Du zeigst.
Welche Distributed-Training-Strategie liefert auf dem konzerneigenen 4x4-A100-Cluster die beste MFU für ein 1,3-B-Parameter-Modell?
Earning criteria — what you'll demonstrate
- Drei Distributed-Training-Strategien praktisch implementieren und vergleichen
- MFU als Engineering-Metrik korrekt berechnen und interpretieren
- GPU-Profiling-Werkzeuge zur Kommunikations-Engpass-Analyse anwenden
- Eine Plattform-Roadmap auf Basis quantitativer Benchmarks begründen
Studienpassung
Wo dies in Dein Studium passt.
Schärft dieselben Fähigkeiten, die Dein Studium von Dir erwartet.
Studienzuordnung folgt in Kürze.
Fähigkeiten
Fähigkeiten, die Du unter Beweis stellst.
Jede taucht auf Deinem verifizierten Zertifikat auf.
- Distributed Training
Apply distributed training to solve real industry problems and demonstrate production-level capability.
- Pytorch
Apply pytorch to solve real industry problems and demonstrate production-level capability.
- Fsdp
Apply fsdp to solve real industry problems and demonstrate production-level capability.
- Pipeline Parallelism
Apply pipeline parallelism to solve real industry problems and demonstrate production-level capability.
- Gpu Profiling
Apply gpu profiling to solve real industry problems and demonstrate production-level capability.
- Benchmarking
Apply benchmarking to solve real industry problems and demonstrate production-level capability.
Karrieren
Berufe, auf die dies Dich vorbereitet.
Echte Berufsbezeichnungen. Echte Skill-Brücken. Wähle die, die Deinem Werdegang am nächsten kommt.
ML-Systems-Ingenieur:in
Wer FSDP, Pipeline-Parallel und MFU-Messung praktisch beherrscht, deckt das Profil ab, das ML-Systems-Teams in Hyperscalern und großen Enterprises 2026 dringend suchen.
Dieses Projekt schärft
- distributed-training
- fsdp
- pipeline-parallelism
MLOps-Ingenieur:in
Profiling, Slurm-Bedienung und reproduzierbare Cluster-Benchmarks sind das Handwerk, das MLOps-Teams beim Aufbau interner GPU-Plattformen täglich brauchen.
Dieses Projekt schärft
- gpu-profiling
- benchmarking
- distributed-training
KI-Lösungsarchitekt:in
Die Übung, eine Verteilungsstrategie quantitativ zu rechtfertigen und in eine Roadmap zu gießen, bildet exakt die Architektur-Empfehlungs-Arbeit ab, die Solutions Architects an Plattform-Teams liefern.
Dieses Projekt schärft
- benchmarking
- pytorch
- gpu-profiling
Noch eine Sache