GuíaBásico

Guía de Fundamentos de Data Engineering

Da el salto de "sé programar en Python" a "pienso y construyo como data engineer". Esta guía abre el ecosistema de Data Engineering: te enseña el ciclo de vida del dato (extracción, almacenamiento, transformación, servido), la decisión batch vs streaming gobernada por el SLA del negocio (no por la herramienta de moda), ETL vs ELT y qué cambió con el warehouse en la nube, almacenamiento columnar con Parquet, un primer modelo de hechos y dimensiones, compuertas de calidad antes de cargar, y el pilar que la evidencia de mercado marca como el más crítico de omitir: idempotencia y backfill. Todo el hilo se ejecuta de verdad, en Python 3 estándar (con DuckDB como única dependencia opcional), sobre el caso de Kiosko, una cadena ficticia de tiendas de conveniencia con datos de ventas (`orders`) y eventos de app (`events`). Cierra con un capstone que integra todo en un pipeline bronze-silver-gold, particionado, validado y consultado con DuckDB.

64
lecciones
8
módulos
Inglés · Español
disponible en
certificado
Gratis
acceso
NIEVA

Resultados

Lo que vas a poder hacer

  • Ubicar el rol del data engineer en 2026 dentro del ciclo de vida del dato (generación, ingestión, almacenamiento, transformación, servido) y leer tu primer archivo de Kiosko con `csv.DictReader`
  • Aplicar el framework de decisión batch vs streaming según el SLA del negocio, y extraer un rango de archivos diarios con `pathlib.Path.glob`
  • Distinguir ETL de ELT y OLTP de OLAP, cargar datos crudos en SQLite sin transformar y transformarlos después con `SELECT`, y hacer tu primera consulta con DuckDB sobre un archivo Parquet
  • Diseñar un primer modelo de datos con una tabla de hechos (`fact_orders`) y dos dimensiones (`dim_store`, `dim_product`), unidas por diccionario en Python con una columna derivada (`revenue`)
  • Construir una compuerta de calidad (`validate_orders`) que separa filas válidas de filas rotas por esquema, nulos, tipo y rango, sin detener el pipeline
  • Garantizar que una pipeline sea segura de re-correr con el patrón overwrite-partition, y escribir una función de backfill que recalcula un rango de fechas
  • Particionar datos por fecha en disco y encadenar extracción, validación, transformación y carga en una sola función de orquestación mínima con logging
  • Integrar todo en un pipeline bronze-silver-gold que procesa una semana completa de Kiosko y produce un reporte de ventas por tienda y producto

Antes de empezar

Qué necesitas traer

Es para ti si...

  • Developers Python que ya saben programar y quieren entrar a data engineering con fundamentos sólidos, no solo con nombres de herramientas
  • Analistas de datos o BI que quieren dar el salto a construir pipelines, no solo consultarlos
  • Devs que necesitan decidir con criterio entre batch y streaming, ETL y ELT, antes de elegir una herramienta
  • Cualquiera que quiera entender idempotencia y backfill antes de tocar un orquestador real

Requisitos y materiales

  • Python intermedio: funciones, clases, manejo de archivos, comprensión de listas
  • Laptop propia con Python 3 instalado — todo corre local y con $0, sin cuenta de nube
  • No se requiere experiencia previa con SQL, warehouses ni herramientas de datos

Contenido

El temario, módulo por módulo

Abre cualquiera para ver sus lecciones.

Dudas frecuentes

Lo que suele preguntarse

Empieza cuando quieras

Reseñas

Lo que dicen los estudiantes

Estas reseñas son de estudiantes inscritos que completaron al menos el 50% del curso. Moderamos las reseñas solo por motivos de contenido (spam, lenguaje ofensivo, datos personales), nunca por ser críticas o negativas.

Aún no hay reseñas aprobadas.

¡Sé el primero en compartir tu experiencia!