GuíaAvanzado
Guía de Frameworks de Evaluación
Domina la evaluación de sistemas de AI — desde métricas para chat, RAG y agents hasta LLM-as-judge, RAGAS, TruLens y pipelines de evaluación en producción. Esta guía te enseña a construir golden datasets, implementar evaluación específica por dominio para chatbots, pipelines RAG y agentes de AI, automatizar la evaluación con LLM judges calibrados, y deployar monitoring continuo con integración CI/CD y detección de regresiones. Para AI Engineers que ya construyen sistemas y necesitan saber si realmente funcionan bien.
- 64
- lecciones
- 8
- módulos
- Inglés · Español
- disponible en
- Sí
- certificado
- Gratis
- acceso
Resultados
Lo que vas a poder hacer
- Entender por qué la evaluación es el gap más crítico en AI Engineering y adoptar evaluation-driven development
- Dominar la taxonomía de métricas: reference-based (BLEU, ROUGE, BERTScore), reference-free, semánticas y custom
- Diseñar golden datasets profesionales con estrategias de annotation, synthetic data y versionado
- Evaluar chatbots con métricas de response quality, safety checks, evaluación multi-turn y TruLens
- Evaluar pipelines RAG con RAGAS: faithfulness, answer relevancy, context precision y recall
- Evaluar agentes de AI con trajectory evaluation, tool call accuracy y métricas de task completion
- Implementar LLM-as-judge con prompts calibrados, mitigación de sesgo, pairwise comparison y multi-judge consensus
- Construir pipelines de evaluación en producción con CI/CD gates, monitoring continuo, regression detection y alerting
Antes de empezar
Qué necesitas traer
Es para ti si...
- AI Engineers que construyen sistemas de chat, RAG o agents y necesitan medir su calidad de forma rigurosa
- Developers que deployean sistemas de AI a producción sin saber si realmente funcionan bien
- Ingenieros que necesitan implementar evaluación en el pipeline CI/CD de su empresa
- Equipos en transición de "evaluación por vibes" a métricas de calidad automatizadas y data-driven
- Profesionales que quieren entender LLM-as-judge, RAGAS y TruLens para uso en producción
Requisitos y materiales
- Completar la Guía de Advanced RAG Techniques (#8) o experiencia construyendo pipelines RAG
- Completar la Guía de LangChain & LangGraph (#9) o experiencia equivalente con el framework
- Completar la Guía de Building AI Agents (#11) o experiencia construyendo agentes con tool use
- Python intermedio (funciones, clases, async, Pydantic básico)
- Experiencia con al menos un sistema de AI en desarrollo o producción
- Al menos una API key de proveedor LLM (OpenAI recomendado)
- Python 3.11+ instalado
Contenido
El temario, módulo por módulo
Abre cualquiera para ver sus lecciones.
- 1. Introducción: El Problema que Nadie Quiere Resolver
- 2. El Evaluation Gap en AI Engineering
- 3. Tipos de Evaluación: Offline, Online, Human-in-the-Loop
- 4. Evaluación vs Testing vs Monitoring
- 5. El Costo de No Evaluar
- 6. Evaluation-Driven Development
- 7. De "Vibes" a Métricas: El Mindset Shift
- 8. Proyecto: Primer Pipeline de Evaluación End-to-End
- 1. Introducción: No Todas las Métricas Miden lo Mismo
- 2. Métricas Reference-Based: BLEU, ROUGE, METEOR
- 3. Métricas Semánticas: BERTScore, Cosine Similarity, STS
- 4. Métricas Reference-Free: Evaluar Sin Respuesta Correcta
- 5. Métricas de Clasificación Aplicadas a AI
- 6. Métricas de Generación de Texto
- 7. Diseñar Métricas Custom
- 8. Proyecto: Comparador de Métricas
- 1. Introducción: Sin Datos de Evaluación, No Hay Evaluación
- 2. ¿Qué es un Golden Dataset?
- 3. Diseño de Test Cases Efectivos
- 4. Estrategias de Annotation
- 5. Synthetic Data para Evaluación
- 6. Versionado y Mantenimiento de Golden Datasets
- 7. Test Suites como Contrato de Calidad
- 8. Proyecto: Golden Dataset Profesional
- 1. Introducción: RAG Sin Evaluación es una Caja Negra
- 2. RAG Failure Modes
- 3. Faithfulness: ¿La Respuesta se Basa en el Contexto?
- 4. Answer Relevancy: ¿La Respuesta Responde la Pregunta?
- 5. Context Precision y Context Recall: Evaluando el Retriever
- 6. RAGAS Framework Deep Dive
- 7. Evaluación End-to-End de RAG
- 8. Proyecto Evolutivo: RAG Evaluation Suite
- 1. Introducción: Los Agentes Son los Sistemas Más Difíciles de Evaluar
- 2. Agent Failure Modes
- 3. Trajectory Evaluation
- 4. Tool Call Accuracy: Precisión, Recall y Corrección de Argumentos
- 5. Task Completion y Reasoning Quality
- 6. Evaluación de Sistemas Multi-Agente
- 7. Agent Benchmarks y Datasets
- 8. Proyecto Evolutivo: Agent Evaluation Suite
- 1. Introducción: Evaluación No es un Evento, es un Proceso
- 2. Evaluation en CI/CD
- 3. Monitoring Continuo de Calidad
- 4. Regression Detection y Alerting
- 5. A/B Testing para Sistemas de AI
- 6. Observability con LangSmith y TruLens
- 7. Arquitectura de Evaluación en Producción
- 8. Proyecto Final: Production AI Evaluation Platform
Dónde encaja
Esta guía es parte de algo más grande
Se estudia dentro de estos programas, con acompañamiento y fechas.
Dudas frecuentes
Lo que suele preguntarse
Sin límite. Es una guía gratuita: entras cuando quieras, las veces que quieras.
No. Los módulos están ordenados de menos a más, pero puedes saltar al que necesites. Tu progreso se guarda por lección.
Lo que haga falta está en «Qué necesitas traer», arriba. Si no aparece nada ahí, puedes empezar desde cero.
En el grupo de WhatsApp del Club, y cada quince días hay un live con un instructor donde se resuelven dudas en vivo.
Sí. Al terminar todas las lecciones se emite automáticamente, con un código verificable que puedes compartir en LinkedIn.
No. Esta guía es autoguiada y sin fechas. El bootcamp es en vivo, por cohorte, con entregas que alguien revisa.
Empieza cuando quieras
Lo que dicen los estudiantes
Estas reseñas son de estudiantes inscritos que completaron al menos el 50% del curso. Moderamos las reseñas solo por motivos de contenido (spam, lenguaje ofensivo, datos personales), nunca por ser críticas o negativas.
Aún no hay reseñas aprobadas.
¡Sé el primero en compartir tu experiencia!