GuíaIntermedio

Guía de Confiabilidad y Gobierno de Datos

Un pipeline en verde con datos malos es peor que uno en rojo — porque nadie lo revisa. Esta guía enseña a responder la pregunta que las guías anteriores del ecosistema nunca hicieron: ¿cómo sabes que tu dato es correcto, no solo que el proceso que lo produjo terminó sin error? El caso conductor es Kiosko abriendo su cuarta tienda: el primer archivo de ventas de `S04` llega tarde y con 12 líneas, de las cuales 6 rompen, cada una, una dimensión de calidad distinta — incluyendo una fila que pasa cualquier validación de esquema/tipo/rango pero está mal por dos órdenes de magnitud (el clásico bug de dólares a centavos). Aprendes las seis dimensiones de calidad de datos como vocabulario preciso, tests declarativos con Pandera (elegido sobre Great Expectations y Soda con evidencia de licencia y vendor-risk), contratos de datos versionados en YAML que generan esos mismos tests, detección de anomalías determinista sin Machine Learning, checks de freshness y volumen a nivel de tabla, linaje trazado a mano (con OpenLineage nombrado), y qué hacer cuando un check falla en producción: cuarentena, alerta, runbook. Cierra con gobierno — acceso por rol y enmascaramiento determinista de PII — para que puedas decir con evidencia, no con fe, si tus datos son correctos y quién los puede ver.

64
lecciones
8
módulos
Inglés · Español
disponible en
certificado
Gratis
acceso
NIEVA

Resultados

Lo que vas a poder hacer

  • Nombrar las seis dimensiones de calidad de datos (completeness, uniqueness, validity, consistency, freshness, accuracy) y diagnosticar qué se le escapa a una compuerta de validación básica
  • Escribir tests de calidad declarativos con Pandera (`DataFrameModel`, `Field`, `Check`) sobre datos leídos de DuckDB vía Polars
  • Escribir un check de integridad referencial (anti-join) que atrape una llave foránea huérfana que un esquema declarativo por sí solo no detecta
  • Diseñar un contrato de datos versionado en YAML (esquema + SLA + política de violación), parsearlo con pydantic, y generarlo hacia un esquema de Pandera ejecutable
  • Construir una línea base de precios desde datos limpios y detectar anomalías con reglas y umbrales — sin Machine Learning, siempre explicable en una frase
  • Escribir checks de freshness y volumen a nivel de archivo/tabla, con una referencia de tiempo fija en vez del reloj del sistema
  • Trazar linaje a mano (de dónde viene cada columna) y conocer el estándar abierto OpenLineage como su versión de producción
  • Poner en cuarentena filas rotas en vez de fallar todo el proceso o dejarlas pasar en silencio, generar una alerta estructurada, y escribir un runbook de incidente
  • Definir una política de acceso por rol y enmascarar PII de forma determinista (mismo dato, mismo hash siempre), y publicar un catálogo de datos mínimo

Antes de empezar

Qué necesitas traer

Es para ti si...

  • Data engineers con pipelines que "corren en verde" pero no tienen forma sistemática de probar que el dato adentro es correcto
  • Equipos evaluando agregar Great Expectations o Soda al stack y quieren primero entender el terreno y el trade-off real entre vehículos
  • Cualquiera preparándose para roles o certificaciones donde calidad y gobierno de datos ya pesan fuerte (AWS DEA-C01 Dominio 4, Databricks)
  • Data engineers que completaron las guías anteriores del ecosistema NIEVA y quieren cerrar la pregunta de confianza que ninguna de ellas respondió

Requisitos y materiales

  • Python intermedio y comodidad con DataFrames (Polars o pandas)
  • SQL básico (joins, agregaciones)
  • Ideal haber completado `data-engineering-foundations-guide` (la compuerta de validación local que esta guía diagnostica y reemplaza) y `data-modeling-for-analytics-guide` (el warehouse `kiosko.duckdb` que esta guía audita)

Contenido

El temario, módulo por módulo

Abre cualquiera para ver sus lecciones.

Dudas frecuentes

Lo que suele preguntarse

Empieza cuando quieras

Reseñas

Lo que dicen los estudiantes

Estas reseñas son de estudiantes inscritos que completaron al menos el 50% del curso. Moderamos las reseñas solo por motivos de contenido (spam, lenguaje ofensivo, datos personales), nunca por ser críticas o negativas.

Aún no hay reseñas aprobadas.

¡Sé el primero en compartir tu experiencia!