Construye benchmark de razonamiento jurídico en español
Visión general
De qué trata este proyecto.
Cura 150 preguntas y 30 problemas de derecho civil, evalúa 4 LLMs con juristas y publica resultados. Obtén un certificado verificable.
El escenario
La alianza (8 despachos, unas 600 personas) explora si los LLMs comerciales se acercan a uso productivo en su práctica diaria de derecho civil; un benchmark serio diferencia el ruido de marketing.
El Briefing
Lo que harás y lo que demostrarás.
Producir un benchmark público y reproducible de razonamiento jurídico iberoamericano en español sobre 4 LLMs comerciales y abiertos.
Earning criteria — what you'll demonstrate
- Co-diseñar benchmarks con personas expertas de dominio
- Evaluar LLMs comerciales y abiertos con metodología pública
- Combinar evaluación automática con juicios humanos pareados
- Comunicar resultados a una comunidad profesional no técnica
Encaje académico
Dónde encaja esto en tus estudios.
Afina las mismas habilidades que tu titulación espera de ti.
Large Language Models
Master · Generative Ai
Strong alignment
This challenge maps to Large Language Models at the Master level. It sharpens the same practical skills your coursework expects — but in a real industry context with actual constraints and deliverables.
Habilidades
Habilidades que demostrarás.
Cada una aparece en tu credencial verificada.
- Llm Evaluation
Apply llm evaluation to solve real industry problems and demonstrate production-level capability.
- Benchmarking
Apply benchmarking to solve real industry problems and demonstrate production-level capability.
- Annotation Design
Apply annotation design to solve real industry problems and demonstrate production-level capability.
- Evaluation
Apply evaluation to solve real industry problems and demonstrate production-level capability.
- Experiment Design
Apply experiment design to solve real industry problems and demonstrate production-level capability.
- Python
Write clean, efficient Python for data processing, automation, and backend services.
Carreras
Roles para los que esto te prepara.
Títulos reales. Puentes de habilidades reales. Elige el que más se acerque a tu trayectoria.
Ingeniera de Investigación Aplicada en IA
Construir benchmarks públicos y evaluar LLMs comerciales con rigor es el portafolio que diferencia a una applied AI scientist en legal-tech o sectores especializados.
Este proyecto afina
- llm-evaluation
- benchmarking
- experiment-design
Investigadora de Ciencias
Co-diseño con expertas de dominio y publicación con licencia abierta es trabajo cotidiano de research scientists en colaboraciones academia-industria.
Este proyecto afina
- annotation-design
- evaluation
- benchmarking
Ingeniera de Procesamiento de Lenguaje Natural
Construir pipelines de evaluación reproducibles es competencia central de NLP engineers que sostienen LLMs en producto.
Este proyecto afina
- python
- llm-evaluation
- evaluation