DPO-Finetuning fuer Tonalitaets-Anpassung eines mehrsprachigen Modells
Übersicht
Worum es bei diesem Projekt geht.
Optimiere ein 8B-Modell per DPO-Finetuning, evaluiere mit LLM-Judge und erhalte ein verifizierbares Zertifikat.
Das Briefing
Was Du tust und was Du zeigst.
Implementiere Direct Preference Optimization und vergleiche gegen Supervised Fine-Tuning fuer Tonalitaets-Anpassung eines Open-Source-LLMs.
Earning criteria — what you'll demonstrate
- DPO als reward-freie Alternative zu RLHF verstehen und korrekt implementieren
- SFT vs. DPO empirisch vergleichen mit ehrlichen Metriken
- LoRA-Finetuning fuer effiziente Iteration einsetzen
- Token-Effizienz als Vergabekriterium kommunizieren
Studienpassung
Wo dies in Dein Studium passt.
Schärft dieselben Fähigkeiten, die Dein Studium von Dir erwartet.
Machine Learning from Human Preferences (RLHF and Alignment)
Master · Ai Ml
Fit score: 1
Fähigkeiten
Fähigkeiten, die Du unter Beweis stellst.
Jede taucht auf Deinem verifizierten Zertifikat auf.
Karrieren
Berufe, auf die dies Dich vorbereitet.
Echte Berufsbezeichnungen. Echte Skill-Brücken. Wähle die, die Deinem Werdegang am nächsten kommt.
Karrierewege, die das aufbaut
Kanonische RollenML Researcher
DPO mit Beta-Ablation und ehrlichem Vergleich gegen SFT zu liefern ist Tag-eins-Arbeit eines ML Researchers in AI-Consulting-Firmen und an Foundation-Laboren.
Dieses Projekt schärft
- direct-preference-optimization
- preference-learning
- supervised-finetuning
AI Safety Researcher
Praeferenz-Learning als Alignment-Methode auf ein produktnahes Tonalitaets-Problem anzuwenden bildet die Bruecke zwischen Alignment-Forschung und Industrie-Produkten.
Dieses Projekt schärft
- direct-preference-optimization
- preference-learning
- llm-evaluation
Applied AI Scientist
DPO-Finetuning eines 8B-Modells gegen ein Token-Budget zu validieren und einem B2B-Kundenteam vorzustellen ist Kerngebiet eines Applied AI Scientists.
Dieses Projekt schärft
- lora
- direct-preference-optimization
- llm-evaluation
Noch eine Sache