Optimiza la latencia de inferencia de un LLM para un banco IBEX-35 anonimizado
Visión general
De qué trata este proyecto.
Implementa cuantización INT8, vLLM y tensor parallelism en un LLM bancario. Mides latencia y BLEU. Obtienes un certificado verificable.
El escenario
El banco (cerca de 25.000 empleados en España) ha presupuestado 8 GPU A100 para el piloto interno; cada 0,5 s de latencia mediana ahorrada se traduce en cerca de un 40 % más de adopción según el estudio interno de usabilidad.
El Briefing
Lo que harás y lo que demostrarás.
Reducir la latencia p95 de inferencia del LLM de 2,8 s a menos de 1,2 s sin degradar la calidad más de 2 puntos BLEU.
Earning criteria — what you'll demonstrate
- Aplicar técnicas de cuantización post-entrenamiento sobre un LLM grande
- Diseñar un benchmark de inferencia justo entre runtimes
- Razonar sobre el trade-off latencia/calidad/coste en producción
- Comunicar un Pareto Frontier a un equipo de plataforma
Encaje académico
Dónde encaja esto en tus estudios.
Afina las mismas habilidades que tu titulación espera de ti.
Machine Learning Systems
Master · Ai Systems
Strong alignment
This challenge maps to Machine Learning Systems at the Master level. It sharpens the same practical skills your coursework expects — but in a real industry context with actual constraints and deliverables.
Habilidades
Habilidades que demostrarás.
Cada una aparece en tu credencial verificada.
- Llm Inference
Apply llm inference to solve real industry problems and demonstrate production-level capability.
- Quantization
Apply quantization to solve real industry problems and demonstrate production-level capability.
- Gpu Optimization
Apply gpu optimization to solve real industry problems and demonstrate production-level capability.
- Benchmarking
Apply benchmarking to solve real industry problems and demonstrate production-level capability.
- Model Serving
Apply model serving to solve real industry problems and demonstrate production-level capability.
- Python
Write clean, efficient Python for data processing, automation, and backend services.
Carreras
Roles para los que esto te prepara.
Títulos reales. Puentes de habilidades reales. Elige el que más se acerque a tu trayectoria.
Ingeniero/a de Machine Learning
Optimizar inferencia de LLMs en GPU es uno de los oficios más demandados en banca y SaaS; este reto reproduce el trabajo cotidiano de un MLE de plataforma con foco en latencia.
Este proyecto afina
- llm-inference
- quantization
- model-serving
Ingeniero/a MLOps
Diseñar un benchmark de inferencia reproducible con métricas p95 y documentar el despliegue es trabajo nuclear de MLOps en empresas con tráfico real.
Este proyecto afina
- model-serving
- benchmarking
- gpu-optimization
Arquitecto/a de Soluciones de IA
Traducir un Pareto técnico en una recomendación defendible ante un equipo de plataforma es exactamente lo que un solutions architect hace cada semana.
Este proyecto afina
- benchmarking
- llm-inference
- gpu-optimization