Instruction-Tuning und DPO für einen Customer-Support-Bot
Übersicht
Worum es bei diesem Projekt geht.
Optimiere einen Support-Bot per Instruction-Tuning und DPO auf Llama-3-8B. Vergleiche drei Modelle mit Likert-Bewertung. Erhalte ein verifizierbares Zertifikat.
Das Szenario
Der Anbieter (rund 11.000 Mitarbeitende DACH-weit, börsennotiert) plant einen kontrollierten Roll-out des Bots in einer Tochter; Akzeptanz hängt stark vom Konversations-Ton ab.
Das Briefing
Was Du tust und was Du zeigst.
Verbessere den Konversations-Ton eines Telco-Support-Bots durch Instruction-Tuning + DPO so, dass Service-Mitarbeiter:innen ihn signifikant besser bewerten als Basis und Instruction-only.
Earning criteria — what you'll demonstrate
- Instruction-Tuning als ersten Adaption-Schritt einsetzen
- DPO als Präferenz-Optimierungsmethode ohne Reward-Modell implementieren
- Ablations-Studien sauber aufsetzen, sodass Effekte den Schritten zuordenbar sind
- Konversations-Qualität mit menschlichen Bewertungen statistisch fair messen
Studienpassung
Wo dies in Dein Studium passt.
Schärft dieselben Fähigkeiten, die Dein Studium von Dir erwartet.
Studienzuordnung folgt in Kürze.
Fähigkeiten
Fähigkeiten, die Du unter Beweis stellst.
Jede taucht auf Deinem verifizierten Zertifikat auf.
- Instruction Tuning
Apply instruction tuning to solve real industry problems and demonstrate production-level capability.
- Dpo
Apply dpo to solve real industry problems and demonstrate production-level capability.
- Preference Optimization
Apply preference optimization to solve real industry problems and demonstrate production-level capability.
- Lora
Apply lora to solve real industry problems and demonstrate production-level capability.
- Huggingface
Apply huggingface to solve real industry problems and demonstrate production-level capability.
- Llm Evaluation
Apply llm evaluation to solve real industry problems and demonstrate production-level capability.
Karrieren
Berufe, auf die dies Dich vorbereitet.
Echte Berufsbezeichnungen. Echte Skill-Brücken. Wähle die, die Deinem Werdegang am nächsten kommt.
ML-Forscher:in
Saubere Ablations-Studien an einer Präferenz-Optimierungs-Pipeline zu liefern ist Kernkompetenz von ML-Forschenden in Foundation-Model-Adopters und Industrie-Laboren.
Dieses Projekt schärft
- dpo
- preference-optimization
- instruction-tuning
ML-Ingenieur:in
DPO und Instruction-Tuning als wartbare Trainings-Pipeline aufzusetzen ist eine wachsende Verantwortung von ML-Ingenieurinnen in Foundation-Model-Anwender-Teams.
Dieses Projekt schärft
- lora
- huggingface
- llm-evaluation
NLP-Ingenieur:in
Conversational-Qualität messbar zu verbessern ist genau die Schnittstelle, an der NLP-Ingenieurinnen in Telco-Tech-Teams ihren Wert zeigen.
Dieses Projekt schärft
- instruction-tuning
- llm-evaluation
- dpo
Noch eine Sache