Moteur de recherche multilingue pour un négoce viticole bourguignon
Aperçu
En quoi consiste ce défi.
Concevez un système de recherche multilingue pour un négoce viticole bourguignon et obtenez un certificat vérifiable.
Le scénario
Ce négoce, fondé dans les années 1970, s'est longtemps appuyé sur un réseau d'agents commerciaux locaux pour servir ses marchés asiatiques. Depuis 2022, il développe une plateforme de commande en ligne destinée aux importateurs. Le catalogue papier a été numérisé, mais les fiches produit — rédigées en français par les œnologues — contiennent un vocabulaire technique (« robe rubis aux reflets grenat », « nez de fruits noirs ») difficile à traduire automatiquement. Les importateurs japonais, qui représentent 40 % des ventes export, saisissent des requêtes en kanji ou en romaji, et le moteur de recherche textuel actuel (basé sur une correspondance exacte de mots-clés) ne renvoie aucun résultat.
Le brief
Ce que vous ferez, et ce que vous démontrerez.
Comment construire un moteur de recherche qui retrouve des fiches produit viticoles en français à partir de requêtes formulées en japonais, anglais ou français, en exploitant des plongements lexicaux multilingues et un index inversé adapté ?
Earning criteria — what you'll demonstrate
- Maîtriser la construction d'un index inversé et son adaptation à un contexte multilingue
- Appliquer des modèles de plongements lexicaux multilingues pour aligner des espaces sémantiques entre langues
- Évaluer un système de recherche d'information avec des métriques standard (Recall@k, Mean Reciprocal Rank — la position moyenne inverse du premier résultat pertinent)
- Concevoir une tokenisation adaptée à des langues sans séparateurs d'espaces (japonais, chinois)
Adéquation au programme
Où cela s'inscrit dans votre cursus.
Renforce les mêmes compétences que celles attendues par votre diplôme.
Cursus associés bientôt disponibles.
Compétences
Les compétences que vous démontrerez.
Chacune apparaît sur votre certificat vérifié.
- Information Retrieval
Apply information retrieval to solve real industry problems and demonstrate production-level capability.
- Multilingual Nlp
Apply multilingual nlp to solve real industry problems and demonstrate production-level capability.
- Word Embeddings
Apply word embeddings to solve real industry problems and demonstrate production-level capability.
- Custom Tokenization
Apply custom tokenization to solve real industry problems and demonstrate production-level capability.
- Text Tokenization
Apply text tokenization to solve real industry problems and demonstrate production-level capability.
Débouchés
Les métiers auxquels ce défi vous prépare.
De vrais intitulés. De vraies passerelles de compétences. Choisissez celui qui se rapproche le plus de votre trajectoire.
Les parcours de carrière que ce défi construit
Métiers de référenceIngénieur NLP
Ce défi développe les compétences clés d'un ingénieur NLP : construire un pipeline de traitement multilingue, choisir et intégrer des modèles de plongements, et évaluer rigoureusement la qualité d'un système de recherche textuelle en production.
Ce défi renforce
- multilingual-nlp
- word-embeddings
- custom-tokenization
Ingénieur IA
Le prototype de moteur de recherche vectoriel combine indexation, inférence de modèles pré-entraînés et évaluation quantitative — des tâches quotidiennes d'un ingénieur IA déployant des systèmes intelligents à l'échelle.
Ce défi renforce
- information-retrieval
- word-embeddings
- multilingual-nlp
Architecte de Données
Concevoir un index inversé multilingue et une architecture de recherche hybride (TF-IDF + vectoriel) prépare directement aux choix d'architecture de données que doit faire un architecte pour servir des requêtes à grande échelle.
Ce défi renforce
- information-retrieval
- text-tokenization
- custom-tokenization