Übersicht
Worum es bei diesem Projekt geht.
Optimiere Llama-3-8B auf einer A100 für ein Schweizer Bank-Pilotprojekt und erhalte ein verifizierbares Zertifikat.
Das Briefing
Was Du tust und was Du zeigst.
Welche Inferenz-Konfiguration maximiert Throughput und hält Per-Request-Latenz im Budget für 200 gleichzeitige Berater:innen auf einer einzigen A100?
Earning criteria — what you'll demonstrate
- Modernes LLM-Serving (vLLM, PagedAttention) verstehen und konfigurieren
- Quantisierungs-Trade-offs (Qualität vs. Throughput) ehrlich messen
- Speculative Decoding korrekt einsetzen
- Inferenz-Argumente für regulierte On-Prem-Umgebungen entwickeln
Studienpassung
Wo dies in Dein Studium passt.
Schärft dieselben Fähigkeiten, die Dein Studium von Dir erwartet.
Large Language Models
Master · Ai Ml
Fit score: 1
Fähigkeiten
Fähigkeiten, die Du unter Beweis stellst.
Jede taucht auf Deinem verifizierten Zertifikat auf.
Karrieren
Berufe, auf die dies Dich vorbereitet.
Echte Berufsbezeichnungen. Echte Skill-Brücken. Wähle die, die Deinem Werdegang am nächsten kommt.
Karrierewege, die das aufbaut
Kanonische RollenMLOps-Ingenieur:in
Inferenz-Optimierung mit vLLM und Quantisierung ist die Senior-typische Aufgabe von MLOps-Ingenieur:innen in LLM-betreibenden Teams, besonders in regulierten Branchen.
Dieses Projekt schärft
- llm-inference-optimization
- vllm
- quantization
Machine-Learning-Ingenieur:in
Saubere Benchmark-Methodik und Qualitätskontrolle für Modell-Inferenz sind direkte ML-Engineering-Verantwortlichkeiten in produktnahen Teams.
Dieses Projekt schärft
- benchmarking
- gpu-optimization
- quantization
KI-Solutions-Architekt:in
Inferenz-Architektur und Roll-out-Empfehlungen in regulierten On-Prem-Umgebungen sind klassische Aufgaben von KI-Solutions-Architekt:innen in Banken-IT.
Dieses Projekt schärft
- llm-inference-optimization
- vllm
- speculative-decoding
Noch eine Sache