Übersicht
Worum es bei diesem Projekt geht.
Baue einen GPU-Monitoring-Stack mit Grafana und Prometheus für ein KI-Startup, inklusive Dashboards und Alerts. Du erhältst ein verifizierbares Zertifikat.
Das Szenario
Das Startup hat rund 2 Mio. EUR für das DGX bezahlt und merkt zunehmend, dass viele Trainings-Jobs unter 40 % MFU laufen — die Eigentümer wollen wissen, ob das ein Tooling- oder ein Kultur-Problem ist.
Das Briefing
Was Du tust und was Du zeigst.
Welche GPU-Auslastungs- und Hardware-Health-Daten muss ein Startup-Cluster sichtbar machen, damit Plattform-Team und Research-Lead bessere Entscheidungen treffen?
Earning criteria — what you'll demonstrate
- Einen produktionsfähigen GPU-Monitoring-Stack mit Standard-Werkzeugen aufsetzen
- Beobachtbarkeit so designen, dass zwei verschiedene Personas (Engineer + Research-Lead) bedient werden
- Alerts mit Runbooks koppeln, statt nur Pager-Müll zu produzieren
- Cluster-Auslastungsdaten zu konkreten Operations-Befunden verdichten
Studienpassung
Wo dies in Dein Studium passt.
Schärft dieselben Fähigkeiten, die Dein Studium von Dir erwartet.
Machine Learning Systems
Master · Ai Systems
Strong alignment
This challenge maps to Machine Learning Systems at the Master level. It sharpens the same practical skills your coursework expects — but in a real industry context with actual constraints and deliverables.
Fähigkeiten
Fähigkeiten, die Du unter Beweis stellst.
Jede taucht auf Deinem verifizierten Zertifikat auf.
- Gpu Monitoring
Apply gpu monitoring to solve real industry problems and demonstrate production-level capability.
- Prometheus
Apply prometheus to solve real industry problems and demonstrate production-level capability.
- Grafana
Apply grafana to solve real industry problems and demonstrate production-level capability.
- Observability
Apply observability to solve real industry problems and demonstrate production-level capability.
- Alerting
Apply alerting to solve real industry problems and demonstrate production-level capability.
- Infrastructure
Apply infrastructure to solve real industry problems and demonstrate production-level capability.
Karrieren
Berufe, auf die dies Dich vorbereitet.
Echte Berufsbezeichnungen. Echte Skill-Brücken. Wähle die, die Deinem Werdegang am nächsten kommt.
MLOps-Ingenieur:in
GPU-Monitoring + Alerting mit DCGM/Prometheus/Grafana ist eine direkt produktionsrelevante Kombination, die in fast jeder Junior-MLOps-Stellenausschreibung 2026 auftaucht.
Dieses Projekt schärft
- gpu-monitoring
- prometheus
- grafana
Data Engineer:in
Beobachtbarkeits-Design mit Personas und Runbooks ist eine übertragbare Engineering-Disziplin, die auch Data-Engineering-Teams für ihre Pipelines aufbauen.
Dieses Projekt schärft
- observability
- alerting
- infrastructure
Machine-Learning-Ingenieur:in
Wer Cluster-Auslastung diagnostizieren und Befunde formulieren kann, hebt sich von MLEs ab, die nur Modelle trainieren können und die Plattform für sich arbeiten lassen.
Dieses Projekt schärft
- gpu-monitoring
- infrastructure
- observability
Noch eine Sache