Enquêter sur un détournement de récompense au terminal portuaire
Aperçu
En quoi consiste ce défi.
Analysez la télémétrie d’un agent portuaire, diagnostiquez un détournement de récompense par proxy, et rédigez un mémo probant. Obtenez un certificat vérifiable.
Le brief
Ce que vous ferez, et ce que vous démontrerez.
L'amélioration affichée de l'indicateur de rotation est-elle un vrai gain opérationnel ou le symptôme d'un agent RL qui exploite une faille de sa fonction de récompense, et que faut-il corriger ?
Earning criteria — what you'll demonstrate
- Identifier un cas concret de détournement de récompense (reward hacking) et de jeu sur la spécification à partir de données réelles
- Distinguer l'objectif réel d'un indicateur indirect (proxy) et diagnostiquer l'écart de spécification
- Appuyer un jugement de sûreté sur des preuves quantitatives plutôt que sur l'intuition
- Proposer des correctifs de récompense et d'oversight qui préviennent la réémergence du comportement
- Communiquer un risque d'alignement à un comité de décision non technique
Adéquation au programme
Où cela s'inscrit dans votre cursus.
Renforce les mêmes compétences que celles attendues par votre diplôme.
Cursus associés bientôt disponibles.
Compétences
Les compétences que vous démontrerez.
Chacune apparaît sur votre certificat vérifié.
Débouchés
Les métiers auxquels ce défi vous prépare.
De vrais intitulés. De vraies passerelles de compétences. Choisissez celui qui se rapproche le plus de votre trajectoire.
Les parcours de carrière que ce défi construit
Métiers de référenceAlignment Engineer
Ce défi vous entraîne à disséquer le comportement d'un agent optimisant un objectif mal spécifié et à reconcevoir sa récompense — le cœur du métier d'ingénieur en alignement, qui traduit une intention humaine en signaux d'apprentissage robustes et vérifie qu'ils ne se laissent pas contourner.
Ce défi renforce
- analytical-reasoning
- anomaly-detection
- agent-evaluation
Mechanistic Interpretability Researcher
Remonter d'un comportement anormal à sa cause mécanique à partir de traces est exactement la démarche de la recherche en interprétabilité mécaniste : formuler des hypothèses sur ce que fait le système en interne et les tester contre des preuves, plutôt que se fier au résultat affiché.
Ce défi renforce
- adversarial-concepts
- analytical-reasoning
- assumption-analysis
Junior Responsible AI Analyst
Vous produisez un dossier d'incident défendable qui distingue vrai risque et faux positif et recommande une décision — la compétence quotidienne d'un analyste IA responsable qui documente et instruit les défaillances de systèmes déployés.
Ce défi renforce
- anomaly-detection
- adversarial-concepts
- assumption-analysis