Visión general
De qué trata este proyecto.
Construye una plataforma web con Python y React para evaluar LLMs con tests A/B, Likert y métricas de concordancia. Obtén un certificado verificable.
El escenario
La empresa lanza unos diez modelos nuevos al año entre fine-tunes y prompts; una herramienta interna unificada evita Excels dispersos y acelera ciclos de evaluación de semanas a días.
El Briefing
Lo que harás y lo que demostrarás.
Construir una plataforma interna de evaluación humana para LLMs con tres tipos de evaluación, control de concordancia y exportación, lista para uso en producción interna.
Earning criteria — what you'll demonstrate
- Construir herramientas internas de evaluación humana usables
- Implementar cálculo de concordancia entre evaluadoras
- Diseñar muestreo y asignación bloqueada para reducir sesgo
- Entregar producto interno con despliegue y documentación
Encaje académico
Dónde encaja esto en tus estudios.
Afina las mismas habilidades que tu titulación espera de ti.
AI Software Engineering Group Project
Master · Capstone
Strong alignment
This challenge maps to AI Software Engineering Group Project at the Master level. It sharpens the same practical skills your coursework expects — but in a real industry context with actual constraints and deliverables.
Habilidades
Habilidades que demostrarás.
Cada una aparece en tu credencial verificada.
- Software Engineering
Apply software engineering to solve real industry problems and demonstrate production-level capability.
- Human Evaluation
Apply human evaluation to solve real industry problems and demonstrate production-level capability.
- Full Stack Development
Apply full stack development to solve real industry problems and demonstrate production-level capability.
- System Design
Apply system design to solve real industry problems and demonstrate production-level capability.
- Python
Write clean, efficient Python for data processing, automation, and backend services.
- Model Evaluation
Apply model evaluation to solve real industry problems and demonstrate production-level capability.
Carreras
Roles para los que esto te prepara.
Títulos reales. Puentes de habilidades reales. Elige el que más se acerque a tu trayectoria.
Ingeniero de IA
Construir herramientas internas de evaluación humana para LLMs es trabajo directo de un AI Engineer en empresas que escalan productos generativos.
Este proyecto afina
- full-stack-development
- human-evaluation
- software-engineering
Científico de Datos Aplicado a IA
Implementar concordancia entre evaluadoras y muestreo estratificado es palanca directa de un científico aplicado a IA en evaluación de LLMs.
Este proyecto afina
- human-evaluation
- model-evaluation
- system-design
Diseñador de Producto de IA
Diseñar el flujo del evaluador para reducir fatiga y mejorar consistencia es ejercicio directo del rol emergente de AI Product Designer en herramientas internas.
Este proyecto afina
- full-stack-development
- human-evaluation
- system-design