Übersicht
Worum es bei diesem Projekt geht.
Optimiere Llama-3-8B auf einer A100 für ein Schweizer Bank-Pilotprojekt und erhalte ein verifizierbares Zertifikat.
Das Szenario
Die Bank steht unter regulatorischer Auflage, alle KI-Inferenz on-prem zu betreiben; Modell-Auswahl ist gesetzt, einzig Inferenz-Konfiguration ist offen.
Das Briefing
Was Du tust und was Du zeigst.
Welche Inferenz-Konfiguration maximiert Throughput und hält Per-Request-Latenz im Budget für 200 gleichzeitige Berater:innen auf einer einzigen A100?
Earning criteria — what you'll demonstrate
- Modernes LLM-Serving (vLLM, PagedAttention) verstehen und konfigurieren
- Quantisierungs-Trade-offs (Qualität vs. Throughput) ehrlich messen
- Speculative Decoding korrekt einsetzen
- Inferenz-Argumente für regulierte On-Prem-Umgebungen entwickeln
Studienpassung
Wo dies in Dein Studium passt.
Schärft dieselben Fähigkeiten, die Dein Studium von Dir erwartet.
Large Language Models
Master · Generative Ai
Strong alignment
This challenge maps to Large Language Models at the Master level. It sharpens the same practical skills your coursework expects — but in a real industry context with actual constraints and deliverables.
Fähigkeiten
Fähigkeiten, die Du unter Beweis stellst.
Jede taucht auf Deinem verifizierten Zertifikat auf.
- Llm Inference Optimization
Apply llm inference optimization to solve real industry problems and demonstrate production-level capability.
- Vllm
Apply vllm to solve real industry problems and demonstrate production-level capability.
- Quantization
Apply quantization to solve real industry problems and demonstrate production-level capability.
- Speculative Decoding
Apply speculative decoding to solve real industry problems and demonstrate production-level capability.
- Benchmarking
Apply benchmarking to solve real industry problems and demonstrate production-level capability.
- Gpu Optimization
Apply gpu optimization to solve real industry problems and demonstrate production-level capability.
Karrieren
Berufe, auf die dies Dich vorbereitet.
Echte Berufsbezeichnungen. Echte Skill-Brücken. Wähle die, die Deinem Werdegang am nächsten kommt.
MLOps-Ingenieur:in
Inferenz-Optimierung mit vLLM und Quantisierung ist die Senior-typische Aufgabe von MLOps-Ingenieur:innen in LLM-betreibenden Teams, besonders in regulierten Branchen.
Dieses Projekt schärft
- llm-inference-optimization
- vllm
- quantization
Machine-Learning-Ingenieur:in
Saubere Benchmark-Methodik und Qualitätskontrolle für Modell-Inferenz sind direkte ML-Engineering-Verantwortlichkeiten in produktnahen Teams.
Dieses Projekt schärft
- benchmarking
- gpu-optimization
- quantization
KI-Solutions-Architekt:in
Inferenz-Architektur und Roll-out-Empfehlungen in regulierten On-Prem-Umgebungen sind klassische Aufgaben von KI-Solutions-Architekt:innen in Banken-IT.
Dieses Projekt schärft
- llm-inference-optimization
- vllm
- speculative-decoding
Noch eine Sache