Capability- und Safety-Evaluation für ein Open-Source-LLM
Übersicht
Worum es bei diesem Projekt geht.
Teste ein Open-Source-LLM mit MMLU und ToxiGen, dokumentiere die Ergebnisse und erstelle eine Modellkarte. Du erhältst ein verifizierbares Zertifikat.
Das Szenario
Der Verein hat etwa zwanzig aktive Mitwirkende, finanziert sich aus Spenden und einem öffentlichen Förderprogramm. Die Modell-Veröffentlichung ist ein Meilenstein, soll aber nicht ohne belastbare Evaluation passieren — das ist intern als Mindeststandard verabredet.
Das Briefing
Was Du tust und was Du zeigst.
Wie führt man eine reproduzierbare, kombinierte Capability- und Safety-Evaluation für ein deutschsprachiges Open-Source-LLM durch — und welche Benchmarks sind dafür wirklich tauglich?
Earning criteria — what you'll demonstrate
- Etablierte LLM-Benchmark-Suites praktisch durchführen und kritisch einordnen
- Capability- und Safety-Evaluation in ein gemeinsames Reporting integrieren
- Sprachspezifische Limitierungen englischsprachiger Benchmarks erkennen und kommunizieren
- Modell-Karten-Standards der EU für Open-Source-Modelle anwenden
Studienpassung
Wo dies in Dein Studium passt.
Schärft dieselben Fähigkeiten, die Dein Studium von Dir erwartet.
AI Measurement and Evaluation
Master · Responsible Ai
Strong alignment
This challenge maps to AI Measurement and Evaluation at the Master level. It sharpens the same practical skills your coursework expects — but in a real industry context with actual constraints and deliverables.
Fähigkeiten
Fähigkeiten, die Du unter Beweis stellst.
Jede taucht auf Deinem verifizierten Zertifikat auf.
- Capability Evaluation
Apply capability evaluation to solve real industry problems and demonstrate production-level capability.
- Safety Evaluation
Apply safety evaluation to solve real industry problems and demonstrate production-level capability.
- Benchmark Design
Apply benchmark design to solve real industry problems and demonstrate production-level capability.
- Llm Evaluation
Apply llm evaluation to solve real industry problems and demonstrate production-level capability.
- Python
Write clean, efficient Python for data processing, automation, and backend services.
- Model Cards
Apply model cards to solve real industry problems and demonstrate production-level capability.
- Responsible Disclosure
Apply responsible disclosure to solve real industry problems and demonstrate production-level capability.
Karrieren
Berufe, auf die dies Dich vorbereitet.
Echte Berufsbezeichnungen. Echte Skill-Brücken. Wähle die, die Deinem Werdegang am nächsten kommt.
AI Safety Researcher
Safety-Evaluations sind das Tagesgeschäft von AI Safety Researchern in offenen Modell-Communities. Die Challenge übt das volle Repertoire von Benchmark-Wahl bis zur Modell-Karte.
Dieses Projekt schärft
- safety-evaluation
- responsible-disclosure
- benchmark-design
ML Researcher
Die kritische Diskussion der Benchmark-Tauglichkeit ist eine zentrale ML-Researcher-Tätigkeit. Diese Challenge bietet einen sehr realistischen Einstieg in genau diese Diskussion.
Dieses Projekt schärft
- capability-evaluation
- llm-evaluation
- benchmark-design
NLP Engineer
NLP Engineers, die deutschsprachige Modelle in Produktion bringen, müssen die Benchmark-Limitierungen verstehen. Die Challenge baut diese Kompetenz konkret auf.
Dieses Projekt schärft
- llm-evaluation
- model-cards
- capability-evaluation
Noch eine Sache