Razonamiento visual para auditar etiquetado vial en delivery autónomo
Visión general
De qué trata este proyecto.
Construye un sistema VQA afinando un MLLM con LoRA sobre 800 imágenes de delivery autónomo. Mides exactitud, latencia y fallos. Obtienes un certificado verificable.
El escenario
La startup (~35 personas, ~22 M USD levantados) tiene una flota de 18 robots y un objetivo declarado de ampliar a 100 robots en 12 meses; cada incidente de microbloqueo cuesta una intervención manual remota de unos 6-8 minutos de un operador.
El Briefing
Lo que harás y lo que demostrarás.
Construir un sistema de Visual Question Answering capaz de responder 12 preguntas de seguridad vial sobre la vista frontal de un robot de reparto, con exactitud superior al 78% y latencia inferior a 1,5 segundos.
Earning criteria — what you'll demonstrate
- Aplicar Modelos de Lenguaje Multimodales Grandes (MLLM) a tareas de razonamiento visual
- Afinar un modelo grande con LoRA bajo restricciones de memoria de GPU
- Evaluar VQA con exactitud por pregunta más análisis cualitativo de fallos
- Conectar la percepción robótica con razonamiento de alto nivel en lenguaje natural
Encaje académico
Dónde encaja esto en tus estudios.
Afina las mismas habilidades que tu titulación espera de ti.
Visual Intelligence and Visual Reasoning
Master · Computer Vision
Strong alignment
This challenge maps to Visual Intelligence and Visual Reasoning at the Master level. It sharpens the same practical skills your coursework expects — but in a real industry context with actual constraints and deliverables.
Habilidades
Habilidades que demostrarás.
Cada una aparece en tu credencial verificada.
- Visual Question Answering
Apply visual question answering to solve real industry problems and demonstrate production-level capability.
- Multimodal Llm
Apply multimodal llm to solve real industry problems and demonstrate production-level capability.
- Lora Fine Tuning
Apply lora fine tuning to solve real industry problems and demonstrate production-level capability.
- Scene Understanding
Apply scene understanding to solve real industry problems and demonstrate production-level capability.
- Model Evaluation
Apply model evaluation to solve real industry problems and demonstrate production-level capability.
- Pytorch
Apply pytorch to solve real industry problems and demonstrate production-level capability.
Carreras
Roles para los que esto te prepara.
Títulos reales. Puentes de habilidades reales. Elige el que más se acerque a tu trayectoria.
Computer Vision Engineer
Conectar percepción robótica con razonamiento visual multimodal es exactamente la siguiente generación de trabajo CV que las empresas de autónomos demandan; este reto entrega un proyecto completo para mostrar en entrevistas.
Este proyecto afina
- visual-question-answering
- scene-understanding
- model-evaluation
Applied AI Scientist
Afinar un MLLM con LoRA sobre un dataset propio y reportar exactitud más fallos accionables es el día a día de una persona Applied AI Scientist en una startup de autónomos o de IA física.
Este proyecto afina
- lora-fine-tuning
- multimodal-llm
- model-evaluation
Machine Learning Engineer
Servir un MLLM con presupuesto de latencia en GPU y reproducibilidad estricta refleja cómo los MLEs ponen modelos multimodales en producción.
Este proyecto afina
- pytorch
- multimodal-llm
- model-evaluation