GuíaAvanzado

Guía de Frameworks de Evaluación

Domina la evaluación de sistemas de AI — desde métricas para chat, RAG y agents hasta LLM-as-judge, RAGAS, TruLens y pipelines de evaluación en producción. Esta guía te enseña a construir golden datasets, implementar evaluación específica por dominio para chatbots, pipelines RAG y agentes de AI, automatizar la evaluación con LLM judges calibrados, y deployar monitoring continuo con integración CI/CD y detección de regresiones. Para AI Engineers que ya construyen sistemas y necesitan saber si realmente funcionan bien.

64
lecciones
8
módulos
Inglés · Español
disponible en
certificado
Gratis
acceso
NIEVA

Resultados

Lo que vas a poder hacer

  • Entender por qué la evaluación es el gap más crítico en AI Engineering y adoptar evaluation-driven development
  • Dominar la taxonomía de métricas: reference-based (BLEU, ROUGE, BERTScore), reference-free, semánticas y custom
  • Diseñar golden datasets profesionales con estrategias de annotation, synthetic data y versionado
  • Evaluar chatbots con métricas de response quality, safety checks, evaluación multi-turn y TruLens
  • Evaluar pipelines RAG con RAGAS: faithfulness, answer relevancy, context precision y recall
  • Evaluar agentes de AI con trajectory evaluation, tool call accuracy y métricas de task completion
  • Implementar LLM-as-judge con prompts calibrados, mitigación de sesgo, pairwise comparison y multi-judge consensus
  • Construir pipelines de evaluación en producción con CI/CD gates, monitoring continuo, regression detection y alerting

Antes de empezar

Qué necesitas traer

Es para ti si...

  • AI Engineers que construyen sistemas de chat, RAG o agents y necesitan medir su calidad de forma rigurosa
  • Developers que deployean sistemas de AI a producción sin saber si realmente funcionan bien
  • Ingenieros que necesitan implementar evaluación en el pipeline CI/CD de su empresa
  • Equipos en transición de "evaluación por vibes" a métricas de calidad automatizadas y data-driven
  • Profesionales que quieren entender LLM-as-judge, RAGAS y TruLens para uso en producción

Requisitos y materiales

  • Completar la Guía de Advanced RAG Techniques (#8) o experiencia construyendo pipelines RAG
  • Completar la Guía de LangChain & LangGraph (#9) o experiencia equivalente con el framework
  • Completar la Guía de Building AI Agents (#11) o experiencia construyendo agentes con tool use
  • Python intermedio (funciones, clases, async, Pydantic básico)
  • Experiencia con al menos un sistema de AI en desarrollo o producción
  • Al menos una API key de proveedor LLM (OpenAI recomendado)
  • Python 3.11+ instalado

Contenido

El temario, módulo por módulo

Abre cualquiera para ver sus lecciones.

Dónde encaja

Esta guía es parte de algo más grande

Se estudia dentro de estos programas, con acompañamiento y fechas.

Dudas frecuentes

Lo que suele preguntarse

Empieza cuando quieras

Reseñas

Lo que dicen los estudiantes

Estas reseñas son de estudiantes inscritos que completaron al menos el 50% del curso. Moderamos las reseñas solo por motivos de contenido (spam, lenguaje ofensivo, datos personales), nunca por ser críticas o negativas.

Aún no hay reseñas aprobadas.

¡Sé el primero en compartir tu experiencia!