Diseña una evaluación honesta de un LLM generativo para una EdTech
Visión general
De qué trata este proyecto.
Evalúa un LLM en 800 problemas de matemáticas con métricas de accuracy, alucinación y consistencia. Obtén un certificado verificable.
El escenario
La EdTech sirve a más de 40.000 estudiantes; un asistente que alucine de forma confiada en un tema crítico (ej. álgebra básica) erosiona confianza padres-plataforma — la evaluación tiene que ser honesta para guiar bien el lanzamiento.
El Briefing
Lo que harás y lo que demostrarás.
Diseña y ejecuta evaluación multi-dimensional de un LLM generativo para tutorización matemática, con recomendaciones de lanzamiento.
Earning criteria — what you'll demonstrate
- Diseñar evaluación multi-dimensional de LLMs (no solo accuracy ciega)
- Aplicar LLM-as-judge correctamente (con sesgos identificados y mitigados)
- Detectar alucinaciones de forma sistemática
- Producir recomendaciones de lanzamiento defendibles basadas en evidencia
Encaje académico
Dónde encaja esto en tus estudios.
Afina las mismas habilidades que tu titulación espera de ti.
Deep Generative Models
Master · Generative Ai
Strong alignment
This challenge maps to Deep Generative Models at the Master level. It sharpens the same practical skills your coursework expects — but in a real industry context with actual constraints and deliverables.
Habilidades
Habilidades que demostrarás.
Cada una aparece en tu credencial verificada.
- Llm Evaluation
Apply llm evaluation to solve real industry problems and demonstrate production-level capability.
- Prompt Engineering
Apply prompt engineering to solve real industry problems and demonstrate production-level capability.
- Llm As Judge
Apply llm as judge to solve real industry problems and demonstrate production-level capability.
- Hallucination Detection
Apply hallucination detection to solve real industry problems and demonstrate production-level capability.
- Python
Write clean, efficient Python for data processing, automation, and backend services.
- Transformers
Apply transformers to solve real industry problems and demonstrate production-level capability.
Carreras
Roles para los que esto te prepara.
Títulos reales. Puentes de habilidades reales. Elige el que más se acerque a tu trayectoria.
Ingeniero de IA
Evaluación honesta de LLMs antes de lanzar es exactamente el trabajo del AI engineer en empresas que toman producto LLM en serio.
Este proyecto afina
- llm-evaluation
- prompt-engineering
- hallucination-detection
Ingeniero de Prompts
Diseñar prompting baseline + few-shot y medir consistencia es habilidad central del prompt engineer.
Este proyecto afina
- prompt-engineering
- llm-evaluation
- transformers
Investigador de Seguridad en IA
Detectar alucinaciones sistemáticamente y proponer guardrails es trabajo cotidiano del AI safety researcher en producto.
Este proyecto afina
- hallucination-detection
- llm-evaluation
- llm-as-judge