GuíaIntermedio
Guía de Confiabilidad y Gobierno de Datos
Un pipeline en verde con datos malos es peor que uno en rojo — porque nadie lo revisa. Esta guía enseña a responder la pregunta que las guías anteriores del ecosistema nunca hicieron: ¿cómo sabes que tu dato es correcto, no solo que el proceso que lo produjo terminó sin error? El caso conductor es Kiosko abriendo su cuarta tienda: el primer archivo de ventas de `S04` llega tarde y con 12 líneas, de las cuales 6 rompen, cada una, una dimensión de calidad distinta — incluyendo una fila que pasa cualquier validación de esquema/tipo/rango pero está mal por dos órdenes de magnitud (el clásico bug de dólares a centavos). Aprendes las seis dimensiones de calidad de datos como vocabulario preciso, tests declarativos con Pandera (elegido sobre Great Expectations y Soda con evidencia de licencia y vendor-risk), contratos de datos versionados en YAML que generan esos mismos tests, detección de anomalías determinista sin Machine Learning, checks de freshness y volumen a nivel de tabla, linaje trazado a mano (con OpenLineage nombrado), y qué hacer cuando un check falla en producción: cuarentena, alerta, runbook. Cierra con gobierno — acceso por rol y enmascaramiento determinista de PII — para que puedas decir con evidencia, no con fe, si tus datos son correctos y quién los puede ver.
- 64
- lecciones
- 8
- módulos
- Inglés · Español
- disponible en
- Sí
- certificado
- Gratis
- acceso
Resultados
Lo que vas a poder hacer
- Nombrar las seis dimensiones de calidad de datos (completeness, uniqueness, validity, consistency, freshness, accuracy) y diagnosticar qué se le escapa a una compuerta de validación básica
- Escribir tests de calidad declarativos con Pandera (`DataFrameModel`, `Field`, `Check`) sobre datos leídos de DuckDB vía Polars
- Escribir un check de integridad referencial (anti-join) que atrape una llave foránea huérfana que un esquema declarativo por sí solo no detecta
- Diseñar un contrato de datos versionado en YAML (esquema + SLA + política de violación), parsearlo con pydantic, y generarlo hacia un esquema de Pandera ejecutable
- Construir una línea base de precios desde datos limpios y detectar anomalías con reglas y umbrales — sin Machine Learning, siempre explicable en una frase
- Escribir checks de freshness y volumen a nivel de archivo/tabla, con una referencia de tiempo fija en vez del reloj del sistema
- Trazar linaje a mano (de dónde viene cada columna) y conocer el estándar abierto OpenLineage como su versión de producción
- Poner en cuarentena filas rotas en vez de fallar todo el proceso o dejarlas pasar en silencio, generar una alerta estructurada, y escribir un runbook de incidente
- Definir una política de acceso por rol y enmascarar PII de forma determinista (mismo dato, mismo hash siempre), y publicar un catálogo de datos mínimo
Antes de empezar
Qué necesitas traer
Es para ti si...
- Data engineers con pipelines que "corren en verde" pero no tienen forma sistemática de probar que el dato adentro es correcto
- Equipos evaluando agregar Great Expectations o Soda al stack y quieren primero entender el terreno y el trade-off real entre vehículos
- Cualquiera preparándose para roles o certificaciones donde calidad y gobierno de datos ya pesan fuerte (AWS DEA-C01 Dominio 4, Databricks)
- Data engineers que completaron las guías anteriores del ecosistema NIEVA y quieren cerrar la pregunta de confianza que ninguna de ellas respondió
Requisitos y materiales
- Python intermedio y comodidad con DataFrames (Polars o pandas)
- SQL básico (joins, agregaciones)
- Ideal haber completado `data-engineering-foundations-guide` (la compuerta de validación local que esta guía diagnostica y reemplaza) y `data-modeling-for-analytics-guide` (el warehouse `kiosko.duckdb` que esta guía audita)
Contenido
El temario, módulo por módulo
Abre cualquiera para ver sus lecciones.
- Presentación del módulo: cuando el verde no significa correcto
- La mentira del checkmark verde
- Las seis dimensiones de calidad de datos
- Lo que `validate_orders()` de foundations ya atrapaba
- Conoce a S04: la cuarta tienda de Kiosko
- Corriendo la compuerta vieja sobre S04
- Qué se le escapa a una compuerta local
- Proyecto: diagnosticando las fallas silenciosas de S04
- Presentación del módulo: tests de calidad declarativos con Pandera
- Qué es, con precisión, un test de calidad declarativo
- Eligiendo un vehículo: Pandera vs. Great Expectations vs. Soda
- Instalando Pandera y construyendo el puente DuckDB → Polars
- Escribiendo tu primer DataFrameModel
- Completeness y uniqueness declarados
- Validity declarado, y cómo leer un reporte de fallos completo
- Proyecto: probando S04 con Pandera
- Presentación del módulo: consistencia y verificaciones referenciales
- Qué significa consistencia entre tablas
- Por qué los esquemas por sí solos no atrapan bugs referenciales
- Escribiendo un check de integridad referencial
- Reglas de consistencia entre columnas
- Atrapando el producto huérfano de S04
- Combinando Pandera con checks a medida
- Proyecto: el reporte de consistencia completo de S04
- Presentación del módulo: contratos de datos como artefactos versionados
- Qué es, con precisión, un data contract
- Escribiendo orders_contract.yaml
- Parseando el contrato con pydantic
- De contrato a esquema de Pandera
- Versionando un contrato que cambia
- ¿Debería S04 poder escribir sin un contrato?
- Proyecto: el primer contrato de datos de Kiosko
- Presentación del módulo: accuracy y detección de anomalías determinista
- Accuracy: la dimensión más difícil de testear
- Por qué una fila válida puede estar mal
- Construyendo una línea base de precios desde la semana limpia de Kiosko
- Detección de anomalías por umbral, sin Machine Learning
- Atrapando el bug de dólares a centavos
- Cuando los umbrales son demasiado estrictos o demasiado laxos
- Proyecto: la auditoría de accuracy de S04
- Presentación del módulo: freshness, volumen y linaje
- Freshness es una pregunta de tabla, no de fila
- Un reloj de referencia fijo, nunca `datetime.now()`
- Escribiendo un check de freshness para S04
- Checks de volumen: muy pocas o demasiadas filas
- Qué responde el linaje que un contrato no responde
- Trazando el linaje de Kiosko a mano
- Proyecto: el reporte de freshness, volumen y linaje de S04
- Presentación del módulo: el incidente y el gobierno de datos
- Qué pasa cuando un check falla en producción
- Poner en cuarentena, en vez de crashear o pasar en silencio
- Escribiendo una alerta y un runbook
- Quién puede ver qué: fundamentos de control de acceso
- Enmascarando PII de forma determinista
- Un catálogo de datos mínimo para Kiosko
- Proyecto: la respuesta al incidente y la política de acceso de S04
- Presentación del módulo: el sistema de confianza completo de Kiosko
- El brief: Kiosko necesita un sistema de confianza, no solo un pipeline
- Ensamblando la compuerta guiada por el contrato
- Corriendo la compuerta completa contra el incidente de S04
- Corriendo la compuerta completa contra un día limpio
- Publicando el catálogo y la política de acceso
- Qué le sigue faltando a Kiosko
- Proyecto: la plataforma de datos confiable de Kiosko
Dudas frecuentes
Lo que suele preguntarse
Sin límite. Es una guía gratuita: entras cuando quieras, las veces que quieras.
No. Los módulos están ordenados de menos a más, pero puedes saltar al que necesites. Tu progreso se guarda por lección.
Lo que haga falta está en «Qué necesitas traer», arriba. Si no aparece nada ahí, puedes empezar desde cero.
En el grupo de WhatsApp del Club, y cada quince días hay un live con un instructor donde se resuelven dudas en vivo.
Sí. Al terminar todas las lecciones se emite automáticamente, con un código verificable que puedes compartir en LinkedIn.
Empieza cuando quieras
Lo que dicen los estudiantes
Estas reseñas son de estudiantes inscritos que completaron al menos el 50% del curso. Moderamos las reseñas solo por motivos de contenido (spam, lenguaje ofensivo, datos personales), nunca por ser críticas o negativas.
Aún no hay reseñas aprobadas.
¡Sé el primero en compartir tu experiencia!