Buscador semántico para la base de conocimiento interna de un banco
Visión general
De qué trata este proyecto.
Indexa 18.000 documentos bancarios con pgvector y embeddings, mides recall@5, y obtienes un certificado verificable.
El escenario
El banco (unos 1.200 empleados, 28 oficinas en el norte peninsular) destina cada año entre 8 y 12 inspecciones internas a responder a la Autoridad Bancaria Europea (EBA); el tiempo del equipo de Riesgos buscando precedentes equivale a unas 7 jornadas-persona por trimestre.
El Briefing
Lo que harás y lo que demostrarás.
Levantar un servicio sandbox de búsqueda semántica sobre la documentación interna de cumplimiento que alcance recall@5 mayor o igual a 0,80 con latencia p95 inferior a 200 ms.
Earning criteria — what you'll demonstrate
- Elegir un modelo de embeddings adecuado al tamaño del corpus y al presupuesto de latencia
- Aplicar estrategias de troceado (tamaño fijo frente a estructural) y medir su impacto en la calidad
- Operar pgvector con índices HNSW (Hierarchical Navigable Small World) dentro de PostgreSQL
- Evaluar recuperación con recall@k y MRR sobre un benchmark anotado a mano
Encaje académico
Dónde encaja esto en tus estudios.
Afina las mismas habilidades que tu titulación espera de ti.
Alineación con asignaturas próximamente.
Habilidades
Habilidades que demostrarás.
Cada una aparece en tu credencial verificada.
- Embedding Models
Apply embedding models to solve real industry problems and demonstrate production-level capability.
- Vector Search
Apply vector search to solve real industry problems and demonstrate production-level capability.
- Pgvector
Apply pgvector to solve real industry problems and demonstrate production-level capability.
- Chunking Strategy
Apply chunking strategy to solve real industry problems and demonstrate production-level capability.
- Evaluation
Apply evaluation to solve real industry problems and demonstrate production-level capability.
- Python
Write clean, efficient Python for data processing, automation, and backend services.
Carreras
Roles para los que esto te prepara.
Títulos reales. Puentes de habilidades reales. Elige el que más se acerque a tu trayectoria.
AI Engineer
Levantar un servicio de recuperación de extremo a extremo (generar embeddings, indexar, servir, medir) es el trabajo del primer día de un ingeniero o ingeniera de IA en cualquier empresa que envíe funciones basadas en Retrieval-Augmented Generation (RAG — generación aumentada con recuperación).
Este proyecto afina
- embedding-models
- vector-search
- pgvector
Machine Learning Engineer
Tratar la recuperación como un sistema medido con benchmarks offline y presupuestos de latencia refleja cómo los Machine Learning Engineers envían sistemas de ranking y recomendación a producción.
Este proyecto afina
- evaluation
- embedding-models
- python
Data Engineer
La pipeline de ingesta y troceado más operar pgvector dentro de PostgreSQL son competencias centrales que los Data Engineers utilizan al desplegar cargas vectoriales junto a datos transaccionales (OLTP).
Este proyecto afina
- chunking-strategy
- pgvector
- python