GuíaBásico
Guía de Fundamentos de Data Engineering
Da el salto de "sé programar en Python" a "pienso y construyo como data engineer". Esta guía abre el ecosistema de Data Engineering: te enseña el ciclo de vida del dato (extracción, almacenamiento, transformación, servido), la decisión batch vs streaming gobernada por el SLA del negocio (no por la herramienta de moda), ETL vs ELT y qué cambió con el warehouse en la nube, almacenamiento columnar con Parquet, un primer modelo de hechos y dimensiones, compuertas de calidad antes de cargar, y el pilar que la evidencia de mercado marca como el más crítico de omitir: idempotencia y backfill. Todo el hilo se ejecuta de verdad, en Python 3 estándar (con DuckDB como única dependencia opcional), sobre el caso de Kiosko, una cadena ficticia de tiendas de conveniencia con datos de ventas (`orders`) y eventos de app (`events`). Cierra con un capstone que integra todo en un pipeline bronze-silver-gold, particionado, validado y consultado con DuckDB.
- 64
- lecciones
- 8
- módulos
- Inglés · Español
- disponible en
- Sí
- certificado
- Gratis
- acceso
Resultados
Lo que vas a poder hacer
- Ubicar el rol del data engineer en 2026 dentro del ciclo de vida del dato (generación, ingestión, almacenamiento, transformación, servido) y leer tu primer archivo de Kiosko con `csv.DictReader`
- Aplicar el framework de decisión batch vs streaming según el SLA del negocio, y extraer un rango de archivos diarios con `pathlib.Path.glob`
- Distinguir ETL de ELT y OLTP de OLAP, cargar datos crudos en SQLite sin transformar y transformarlos después con `SELECT`, y hacer tu primera consulta con DuckDB sobre un archivo Parquet
- Diseñar un primer modelo de datos con una tabla de hechos (`fact_orders`) y dos dimensiones (`dim_store`, `dim_product`), unidas por diccionario en Python con una columna derivada (`revenue`)
- Construir una compuerta de calidad (`validate_orders`) que separa filas válidas de filas rotas por esquema, nulos, tipo y rango, sin detener el pipeline
- Garantizar que una pipeline sea segura de re-correr con el patrón overwrite-partition, y escribir una función de backfill que recalcula un rango de fechas
- Particionar datos por fecha en disco y encadenar extracción, validación, transformación y carga en una sola función de orquestación mínima con logging
- Integrar todo en un pipeline bronze-silver-gold que procesa una semana completa de Kiosko y produce un reporte de ventas por tienda y producto
Antes de empezar
Qué necesitas traer
Es para ti si...
- Developers Python que ya saben programar y quieren entrar a data engineering con fundamentos sólidos, no solo con nombres de herramientas
- Analistas de datos o BI que quieren dar el salto a construir pipelines, no solo consultarlos
- Devs que necesitan decidir con criterio entre batch y streaming, ETL y ELT, antes de elegir una herramienta
- Cualquiera que quiera entender idempotencia y backfill antes de tocar un orquestador real
Requisitos y materiales
- Python intermedio: funciones, clases, manejo de archivos, comprensión de listas
- Laptop propia con Python 3 instalado — todo corre local y con $0, sin cuenta de nube
- No se requiere experiencia previa con SQL, warehouses ni herramientas de datos
Contenido
El temario, módulo por módulo
Abre cualquiera para ver sus lecciones.
- Presentación de la guía: de archivos sueltos a un pipeline en el que puedes confiar
- ¿Qué es data engineering en 2026?
- El ciclo de vida del dato
- Stakeholders upstream y downstream
- Conoce a Kiosko: el caso
- Lee tu primer archivo de datos
- De filas crudas a objetos Python
- Mini-proyecto: explora el crudo de dos días de Kiosko
- Presentación del módulo: la pregunta que va antes de cualquier herramienta
- Procesamiento por lotes: qué es y por qué existe
- Procesamiento en streaming: qué es y por qué existe
- La pregunta del SLA, antes que cualquier herramienta
- ¿Kiosko necesita batch o streaming?
- Extrayendo múltiples archivos con pathlib
- Parseando una semana completa de órdenes
- Mini-proyecto: el trabajo de extracción diaria de Kiosko
- Presentación del módulo 3: qué cambió cuando guardar dejó de ser caro
- ETL vs ELT: qué cambió con el warehouse en la nube
- OLTP vs OLAP: dos trabajos distintos
- El mapa: el warehouse, el lake y el lakehouse
- Almacenamiento columnar y por qué Parquet es distinto
- Cargando datos crudos con SQLite: tu primer ELT
- Una primera mirada a DuckDB
- Mini-proyecto: la zona de aterrizaje de Kiosko
- Presentación del módulo 4: el primer modelo de datos de Kiosko
- Hechos y dimensiones: una primera mirada
- Diseñando la tabla fact_orders de Kiosko
- Diseñando las tablas de dimensión de Kiosko
- Uniendo hechos con dimensiones en Python
- Calculando columnas derivadas
- Escribiendo la función transform_fact_orders
- Mini-proyecto: la primera tabla de hechos de Kiosko
- Presentación del módulo: la compuerta antes de la carga
- Qué puede salir mal en un pipeline
- Verificación de esquema y campos requeridos
- Verificación de nulos y tipo
- Verificación de rango y reglas de negocio
- Cuarentena de filas rotas, no crash del pipeline
- Escribiendo un reporte de validación
- Mini-proyecto: la compuerta de calidad de Kiosko
- Presentación del módulo: por qué correr la pipeline dos veces no debería duplicar nada
- Por qué las pipelines deben ser seguras de re-correr
- El patrón overwrite-partition
- Haciendo idempotente el paso de carga de Kiosko
- Probando la idempotencia: correr dos veces
- Qué es un backfill
- Escribiendo una función de backfill
- Mini-proyecto: la corrida segura de Kiosko
- Presentación del módulo: particionar y encadenar
- Por qué particionar por fecha
- Diseñando el layout de partición de Kiosko
- Encadenando los pasos del pipeline
- Registrando lo que hizo el pipeline
- Manejar el fallo de un paso sin perder la corrida
- Cuándo un script de Python deja de alcanzar
- Proyecto: el pipeline de Kiosko de punta a punta sobre la semana
- Presentación del módulo: el capstone de Kiosko
- El brief: Kiosko necesita un reporte diario
- Construyendo la capa bronze
- Construyendo la capa silver
- Construyendo la capa gold con DuckDB
- Corriendo el pipeline completo sobre una semana
- Qué le falta todavía a Kiosko
- Mini-proyecto: el primer pipeline de producción de Kiosko
Dudas frecuentes
Lo que suele preguntarse
Sin límite. Es una guía gratuita: entras cuando quieras, las veces que quieras.
No. Los módulos están ordenados de menos a más, pero puedes saltar al que necesites. Tu progreso se guarda por lección.
Lo que haga falta está en «Qué necesitas traer», arriba. Si no aparece nada ahí, puedes empezar desde cero.
En el grupo de WhatsApp del Club, y cada quince días hay un live con un instructor donde se resuelven dudas en vivo.
Sí. Al terminar todas las lecciones se emite automáticamente, con un código verificable que puedes compartir en LinkedIn.
Empieza cuando quieras
Lo que dicen los estudiantes
Estas reseñas son de estudiantes inscritos que completaron al menos el 50% del curso. Moderamos las reseñas solo por motivos de contenido (spam, lenguaje ofensivo, datos personales), nunca por ser críticas o negativas.
Aún no hay reseñas aprobadas.
¡Sé el primero en compartir tu experiencia!