Alinea un corpus paralelo ES↔PT para una agencia de localización en Lisboa
Visión general
De qué trata este proyecto.
Alinea un corpus paralelo ES↔PT con embeddings y filtros, obtén ≥1,2M pares precisos y un certificado verificable.
El escenario
La agencia (~60 personas) factura ~5,2 M EUR y un corpus limpio internamente acorta el time-to-onboard de nuevos lingüistas y mejora el rendimiento de sus memorias de traducción.
El Briefing
Lo que harás y lo que demostrarás.
Construir un corpus paralelo ES↔PT con ≥1,2 M oraciones y precisión ≥95 % en gold-standard.
Earning criteria — what you'll demonstrate
- Aplicar embeddings multilingües para emparejado a varios niveles
- Usar algoritmos clásicos de alineamiento (vecalign, bleualign)
- Diseñar filtros de calidad que no sobre-filtren
- Validar calidad con gold-standard manual
Encaje académico
Dónde encaja esto en tus estudios.
Afina las mismas habilidades que tu titulación espera de ti.
Alineación con asignaturas próximamente.
Habilidades
Habilidades que demostrarás.
Cada una aparece en tu credencial verificada.
- Sentence Alignment
Apply sentence alignment to solve real industry problems and demonstrate production-level capability.
- Parallel Corpus
Apply parallel corpus to solve real industry problems and demonstrate production-level capability.
- Multilingual Embeddings
Apply multilingual embeddings to solve real industry problems and demonstrate production-level capability.
- Data Filtering
Apply data filtering to solve real industry problems and demonstrate production-level capability.
- Labse
Apply labse to solve real industry problems and demonstrate production-level capability.
- Python
Write clean, efficient Python for data processing, automation, and backend services.
Carreras
Roles para los que esto te prepara.
Títulos reales. Puentes de habilidades reales. Elige el que más se acerque a tu trayectoria.
Ingeniero/a de Procesamiento de Lenguaje Natural
Construcción de corpus paralelos es una de las habilidades operativas centrales en empresas de localización.
Este proyecto afina
- sentence-alignment
- parallel-corpus
- multilingual-embeddings
Ingeniero/a de Datos
Pipelines de datos con filtros validados es trabajo transversal con data engineering en cualquier startup NLP.
Este proyecto afina
- parallel-corpus
- data-filtering
- python
Ingeniero/a de Machine Learning
Curar datos de entrenamiento con criterios cuantitativos es una habilidad cotidiana de MLE en NLP.
Este proyecto afina
- data-filtering
- multilingual-embeddings
- parallel-corpus