Exploración vs. explotación para recomendación de cursos online
Visión general
De qué trata este proyecto.
Construye tres bandidos (Thompson, epsilon-greedy, UCB1) sobre 6.000 cursos, simula 1M de impresiones y mide regret. Recibe un certificado verificable.
El escenario
La edtech (~40 personas, ~700k usuarios mensuales) gana por suscripción y el CTR de la home explica buena parte de la activación; un experimento RL bien comunicado le da material para la siguiente ronda de inversión.
El Briefing
Lo que harás y lo que demostrarás.
Comparar Thompson sampling, epsilon-greedy y UCB en un simulador de recomendación con 6k cursos y proponer una estrategia ganadora.
Earning criteria — what you'll demonstrate
- Aplicar el dilema exploración vs. explotación con tres estrategias clásicas
- Implementar Thompson sampling sobre Beta-Bernoulli
- Medir regret acumulado correctamente en un simulador
- Comunicar trade-offs de exploración a un equipo de growth
Encaje académico
Dónde encaja esto en tus estudios.
Afina las mismas habilidades que tu titulación espera de ti.
Reinforcement Learning
Master · Reinforcement Learning
Strong alignment
This challenge maps to Reinforcement Learning at the Master level. It sharpens the same practical skills your coursework expects — but in a real industry context with actual constraints and deliverables.
Habilidades
Habilidades que demostrarás.
Cada una aparece en tu credencial verificada.
- Multi Armed Bandits
Apply multi armed bandits to solve real industry problems and demonstrate production-level capability.
- Thompson Sampling
Apply thompson sampling to solve real industry problems and demonstrate production-level capability.
- Reinforcement Learning
Apply reinforcement learning to solve real industry problems and demonstrate production-level capability.
- Python
Write clean, efficient Python for data processing, automation, and backend services.
- Experiment Design
Apply experiment design to solve real industry problems and demonstrate production-level capability.
- Evaluation
Apply evaluation to solve real industry problems and demonstrate production-level capability.
Carreras
Roles para los que esto te prepara.
Títulos reales. Puentes de habilidades reales. Elige el que más se acerque a tu trayectoria.
Científico/a de Datos
Aplicar bandidos a recomendación y comunicar trade-offs a growth es trabajo cotidiano del data scientist en startups de consumer.
Este proyecto afina
- multi-armed-bandits
- experiment-design
- evaluation
Ingeniero/a de Machine Learning
Implementar Thompson sampling, UCB y epsilon-greedy reproduciblemente es la base del MLE en sistemas de recomendación.
Este proyecto afina
- reinforcement-learning
- thompson-sampling
- python
Científico/a Aplicado/a de IA
Convertir un experimento simulado en una recomendación de producto es la franja senior del rol de applied AI scientist en growth.
Este proyecto afina
- multi-armed-bandits
- experiment-design
- evaluation