Síntesis de voz expresiva para audiolibros infantiles en español
Visión general
De qué trata este proyecto.
Usarás XTTS para narrar 3 audiolibros, evaluarás con 25 familias y recomendarás el mejor modelo. Obtienes certificado verificable.
El escenario
La editorial publica cerca de 40 títulos infantiles al año y los costes de narración profesional están en torno a los 350 dólares estadounidenses por hora terminada; la viabilidad del catálogo en audiolibro depende de bajar ese coste sin perder calidad percibida.
El Briefing
Lo que harás y lo que demostrarás.
Comparar dos modelos de síntesis de voz expresiva sobre audiolibros infantiles y entregar una recomendación validada con familias reales.
Earning criteria — what you'll demonstrate
- Entrenar y comparar modelos de síntesis de voz
- Diseñar evaluaciones MOS con audiencias no expertas
- Analizar prosodia y expresividad cualitativamente
- Comunicar recomendaciones a un equipo editorial
Encaje académico
Dónde encaja esto en tus estudios.
Afina las mismas habilidades que tu titulación espera de ti.
Alineación con asignaturas próximamente.
Habilidades
Habilidades que demostrarás.
Cada una aparece en tu credencial verificada.
- Text To Speech
Apply text to speech to solve real industry problems and demonstrate production-level capability.
- Prosody Modeling
Apply prosody modeling to solve real industry problems and demonstrate production-level capability.
- User Research
Conduct interviews, surveys, and usability tests to uncover actionable user insights.
- Pytorch
Apply pytorch to solve real industry problems and demonstrate production-level capability.
- Mean Opinion Score
Apply mean opinion score to solve real industry problems and demonstrate production-level capability.
- Fine Tuning
Apply fine tuning to solve real industry problems and demonstrate production-level capability.
Carreras
Roles para los que esto te prepara.
Títulos reales. Puentes de habilidades reales. Elige el que más se acerque a tu trayectoria.
Investigador/a de Aprendizaje Automático
Comparar modelos de síntesis con evaluación MOS y análisis cualitativo es trabajo de una persona investigadora ML en empresas con producto sobre audio.
Este proyecto afina
- text-to-speech
- prosody-modeling
- mean-opinion-score
Diseñador/a de Producto de IA
Diseñar evaluaciones con familias reales y traducir resultados a decisiones editoriales refleja el día a día de una persona diseñadora de producto de IA en sectores creativos.
Este proyecto afina
- user-research
- text-to-speech
- mean-opinion-score
Ingeniero/a de NLP
Fine-tunear modelos de habla y planificar despliegue es trabajo recurrente de personas NLP en empresas con producto multilingüe de audio.
Este proyecto afina
- fine-tuning
- text-to-speech
- pytorch