Skip to contentSkip to content
Certificados verificados. En cadena. Para siempre.Más información
Ewance
Iniciar sesión
Cover image for Optimiza la latencia de inferencia de un LLM para un banco IBEX-35 anonimizado
Code

Optimiza la latencia de inferencia de un LLM para un banco IBEX-35 anonimizado

FreeVerified credential3 semanasExpert

Visión general

De qué trata este proyecto.

Implementa cuantización INT8, vLLM y tensor parallelism en un LLM bancario. Mides latencia y BLEU. Obtienes un certificado verificable.

El escenario

El banco (cerca de 25.000 empleados en España) ha presupuestado 8 GPU A100 para el piloto interno; cada 0,5 s de latencia mediana ahorrada se traduce en cerca de un 40 % más de adopción según el estudio interno de usabilidad.

CredentialBlockchain-anchored
ShareableLinkedIn-ready
LanguageEnglish
PaceSelf-paced

El Briefing

Lo que harás y lo que demostrarás.

Reducir la latencia p95 de inferencia del LLM de 2,8 s a menos de 1,2 s sin degradar la calidad más de 2 puntos BLEU.

Earning criteria — what you'll demonstrate

  • Aplicar técnicas de cuantización post-entrenamiento sobre un LLM grande
  • Diseñar un benchmark de inferencia justo entre runtimes
  • Razonar sobre el trade-off latencia/calidad/coste en producción
  • Comunicar un Pareto Frontier a un equipo de plataforma

Encaje académico

Dónde encaja esto en tus estudios.

Afina las mismas habilidades que tu titulación espera de ti.

Machine Learning Systems

Master · Ai Systems

Strong alignment

This challenge maps to Machine Learning Systems at the Master level. It sharpens the same practical skills your coursework expects — but in a real industry context with actual constraints and deliverables.

Carreras

Roles para los que esto te prepara.

Títulos reales. Puentes de habilidades reales. Elige el que más se acerque a tu trayectoria.

Ingeniero/a de Machine Learning

Optimizar inferencia de LLMs en GPU es uno de los oficios más demandados en banca y SaaS; este reto reproduce el trabajo cotidiano de un MLE de plataforma con foco en latencia.

Este proyecto afina

  • llm-inference
  • quantization
  • model-serving

Ingeniero/a MLOps

Diseñar un benchmark de inferencia reproducible con métricas p95 y documentar el despliegue es trabajo nuclear de MLOps en empresas con tráfico real.

Este proyecto afina

  • model-serving
  • benchmarking
  • gpu-optimization

Arquitecto/a de Soluciones de IA

Traducir un Pareto técnico en una recomendación defendible ante un equipo de plataforma es exactamente lo que un solutions architect hace cada semana.

Este proyecto afina

  • benchmarking
  • llm-inference
  • gpu-optimization

Una cosa más

Puedes tener una credencial en tu CV para el viernes.