Cursos en esta ruta
Guía de Fundamentos de Data Engineering
Da el salto de "sé programar en Python" a "pienso y construyo como data engineer". Esta guía abre el ecosistema de Data Engineering: te enseña el ciclo de vida del dato (extracción, almacenamiento, transformación, servido), la decisión batch vs streaming gobernada por el SLA del negocio (no por la herramienta de moda), ETL vs ELT y qué cambió con el warehouse en la nube, almacenamiento columnar con Parquet, un primer modelo de hechos y dimensiones, compuertas de calidad antes de cargar, y el pilar que la evidencia de mercado marca como el más crítico de omitir: idempotencia y backfill. Todo el hilo se ejecuta de verdad, en Python 3 estándar (con DuckDB como única dependencia opcional), sobre el caso de Kiosko, una cadena ficticia de tiendas de conveniencia con datos de ventas (`orders`) y eventos de app (`events`). Cierra con un capstone que integra todo en un pipeline bronze-silver-gold, particionado, validado y consultado con DuckDB.
64 lecciones
Guía de Python para Data Engineering
Continúa directo desde `data-engineering-foundations-guide`: mismo caso de Kiosko, mismo pipeline, mismos datos de `orders` y `events` — lo que cambia es cómo está escrito el código que los procesa. Esta guía toma el script plano de foundations y lo convierte, módulo a módulo, en un paquete Python de producción: empaquetado con `uv` (`pyproject.toml`, layout `src/`, `uv.lock`), tests con `pytest` sobre cada función del pipeline, logging estructurado en JSON en vez de `print`, reintentos deterministas con `tenacity` para fallas transitorias, y DuckDB y Polars a fondo como los dos motores de transformación diaria que reemplazan los loops de Python puro y `sqlite3` de foundations. Nunca se usa pandas. Cierra con un capstone que ensambla el paquete completo — instalable, testeado, logueado, resiliente — y compara las tres implementaciones de la misma transformación (loop en Python, SQL con DuckDB, `LazyFrame` con Polars) para probar que producen exactamente el mismo resultado.
64 lecciones
Guía de Modelado de Datos para Analítica
Retoma el modelo plano —un hecho y dos dimensiones— que `data-engineering-foundations-guide` dejó deliberadamente incompleto y lo lleva a modelado dimensional real, sobre el mismo caso de Kiosko. Aprendes el proceso de cuatro pasos de Kimball (proceso de negocio, grano, dimensiones, hechos), a decidir con criterio entre star schema, snowflake y tabla ancha (One Big Table) comparando el costo de join con `EXPLAIN`, a historizar una dimensión que cambia con SCD tipo 1 y tipo 2 usando `MERGE INTO`, a unir hechos con dimensiones históricas por el punto exacto en el tiempo (el error más caro de un modelo dimensional), a deduplicar filas repetidas con `ROW_NUMBER()`/`QUALIFY`, y a construir patrones acumulativos: el accumulating snapshot de Kimball para un funnel de sesiones y el cumulative table design de Zach Wilson con columnas tipo arreglo. Todo corre en SQL ejecutado directo sobre DuckDB, con Python como glue code mínimo. Cierra con un capstone que integra un warehouse analítico completo de Kiosko: star con dimensión historizada, accumulating snapshot, cumulative activity y una tabla ancha para el equipo de BI.
64 lecciones
Guía de dbt y Analytics Engineering
Toma el warehouse dimensional que `data-modeling-for-analytics-guide` diseñó y construyó a mano para Kiosko —star schema, `dim_product` historizado con SCD tipo 2, accumulating snapshot, tabla ancha para BI— y lo convierte en un proyecto de software real con dbt-core + dbt-duckdb. Aprendes la anatomía de un proyecto dbt (sources, staging, marts), el grafo de dependencias con `ref()` y las materializaciones (view, table, incremental), a escribir tests declarativos (los cuatro genéricos de fábrica, un test genérico propio y tests singulares para reglas de negocio), a automatizar el SCD tipo 2 con snapshots de dbt (en vez del `MERGE INTO` escrito a mano), a construir modelos incrementales idempotentes, y a generar documentación y linaje automático con `dbt docs generate`. Todo corre local con dbt-core y dbt-duckdb, sin cuenta de dbt Cloud ni de ningún proveedor cloud. Cierra con un capstone que porta el resto de los marts de Kiosko al proyecto y corre `dbt build` de punta a punta: sources, snapshot, todos los modelos en orden de DAG y todos los tests, con un reporte final `PASS/WARN/ERROR` literal.
64 lecciones
Guía de Airflow y Orquestación Declarativa
Continúa directo desde `python-for-data-engineering-guide`: mismo caso de Kiosko, mismo paquete `kiosko_pipeline` ya instalable, testeado y con reintentos de código. Lo que cambia es quién decide cuándo y cómo corre el pipeline — hasta ahora lo decidía un humano tecleando un comando; desde esta guía lo decide Apache Airflow. Aprendes la anatomía de un DAG con la TaskFlow API (`@dag`/`@task`), envolviendo las funciones ya testeadas de `kiosko_pipeline` sin reescribir su lógica, el `logical_date` como el reloj propio del orquestador (nunca `datetime.now()`), reintentos gestionados por el scheduler como capa distinta y complementaria a los reintentos de código, sensores para esperar datos que todavía no llegaron, backfill con el CLI real de Airflow, y observabilidad del DAG a través de su UI y sus logs. Todo corre local con `airflow standalone`, sin Docker ni cuenta de nube. La guía nombra con honestidad las alternativas del mercado (Dagster, Prefect) sin enseñarlas: lo transferible es idempotencia, DAG, scheduling, retries, backfill, sensores y observabilidad — el vendor específico caduca. Cierra con un capstone que ensambla el DAG completo de Kiosko: programado, con sensor, reintentos por tarea, y backfileable sobre una semana entera.
64 lecciones
Guía de Fundamentos de Docker
Domina Docker aplicado a aplicaciones AI: construye imágenes optimizadas, containeriza apps FastAPI + LLM, orquesta stacks multi-servicio con Docker Compose (API + ChromaDB + Redis), y aplica best practices de producción incluyendo multi-stage builds, secrets management y health checks. 8 módulos progresivos que te llevan de tu primer container a un stack AI production-ready con un solo comando. La puerta de entrada a producción en el AI Engineering Path.
64 lecciones
Guía de Spark y Procesamiento Distribuido
Descubre cuándo tu problema de datos deja de caber en un solo nodo, y qué cambia de verdad cuando lo distribuyes. Esta guía retoma el caso Kiosko (cadena de tiendas de conveniencia) justo donde lo dejaron las guías anteriores del ecosistema — con un warehouse dimensional que corre perfecto en DuckDB — y le agrega un dataset sintético de 10 millones de filas para que particionamiento y shuffle se sientan de verdad en tu laptop. Aprendes Apache Spark en modo local (`local[*]`, $0, sin clúster ni cuenta de nube) con la DataFrame API como vehículo principal: el modelo driver/executors, evaluación perezosa, el costo real de un shuffle en `groupBy`/`join`, broadcast join vs sort-merge join, funciones de ventana a escala, el optimizador Catalyst leído con `.explain()`, cuándo cachear (y cuándo no), Parquet particionado, y por qué un UDF de Python normal es lento frente a un `pandas_udf` vectorizado con Arrow. Ninguna afirmación de rendimiento se mide con cronómetro — todo se sostiene con el plan de ejecución. Cierra con el criterio honesto que la mayoría de guías de Spark del mercado se saltan: cuándo Kiosko (real, 40 filas) NO necesita Spark, y cuándo un Kiosko mucho más grande sí.
64 lecciones
Guía de Lakehouse e Iceberg
Parquet es un formato de archivo, no un formato de tabla — y esta guía te muestra, con el propio caso Kiosko, las cuatro veces que ese límite ya dolió: el `overwrite-partition` no atómico de las lecciones básicas, las columnas `valid_from`/`valid_to` mantenidas a mano para historizar un producto, la misma técnica automatizada con `dbt snapshot`, y el particionado por carpetas de Spark. Aprendes Apache Iceberg, el formato de tabla que resuelve todo eso desde la capa de almacenamiento: transacciones ACID reales, un snapshot inmutable en cada escritura, time travel (`AS OF` un snapshot, sin declarar una sola columna de historia), evolución de esquema sin reescribir datos, partición oculta y evolución de partición, y `MERGE INTO`/upserts nativos. El vehículo principal es PyIceberg, 100% Python y $0 (catálogo local sobre SQLite); Spark aparece una sola vez, en el módulo de `MERGE INTO`, para correr SQL real contra una tabla Iceberg. Delta Lake se nombra por contraste, sin construir una segunda implementación paralela. El hilo que resuelves de punta a punta es el cambio de precio de un producto de Kiosko, recuperado con time travel puro, sin ninguna columna de historia.
64 lecciones
Guía de Streaming con Kafka y Flink
Esta guía empieza probando, con código, el error más caro y mejor documentado del streaming: recalcular en Kafka+Flink el mismo embudo de sesiones que Kiosko ya calculó en batch — y llegar exactamente al mismo `35.3%`, con más infraestructura y cero valor nuevo. A partir de esa prueba, la guía traza la línea real: streaming se justifica en los problemas que el batch, por diseño, no puede resolver, sin importar cuánto lo optimices. Con Apache Kafka (4.x, modo KRaft, $0 local) y Apache Flink/PyFlink corriendo de verdad en Docker, resuelves cuatro casos concretos con Kiosko: detectar en minutos que una tienda dejó de reportar (el caso estrella, contra un DAG diario que no se enteraría hasta mañana), capturar un cambio de precio directo del write-ahead log de Postgres con Debezium (CDC) en vez de declararlo a mano en Python, construir ventanas de tiempo-evento con watermarks sobre un flujo continuo, y mantener estado incremental sin re-sumar el historial completo en cada corrida. La guía es honesta sobre el hueco de mercado de Flink y responde con evidencia nueva (prima salarial de Kafka, ~33% de vacantes senior de streaming en el Reino Unido) sin exagerar el rol de Flink más allá de lo que Kiosko necesita de verdad.
64 lecciones
Guía de Confiabilidad y Gobierno de Datos
Un pipeline en verde con datos malos es peor que uno en rojo — porque nadie lo revisa. Esta guía enseña a responder la pregunta que las guías anteriores del ecosistema nunca hicieron: ¿cómo sabes que tu dato es correcto, no solo que el proceso que lo produjo terminó sin error? El caso conductor es Kiosko abriendo su cuarta tienda: el primer archivo de ventas de `S04` llega tarde y con 12 líneas, de las cuales 6 rompen, cada una, una dimensión de calidad distinta — incluyendo una fila que pasa cualquier validación de esquema/tipo/rango pero está mal por dos órdenes de magnitud (el clásico bug de dólares a centavos). Aprendes las seis dimensiones de calidad de datos como vocabulario preciso, tests declarativos con Pandera (elegido sobre Great Expectations y Soda con evidencia de licencia y vendor-risk), contratos de datos versionados en YAML que generan esos mismos tests, detección de anomalías determinista sin Machine Learning, checks de freshness y volumen a nivel de tabla, linaje trazado a mano (con OpenLineage nombrado), y qué hacer cuando un check falla en producción: cuarentena, alerta, runbook. Cierra con gobierno — acceso por rol y enmascaramiento determinista de PII — para que puedas decir con evidencia, no con fe, si tus datos son correctos y quién los puede ver.
64 lecciones
Guía de Monitoreo y Observabilidad
Domina la observabilidad de sistemas AI en producción con OpenTelemetry, el estándar de la industria en 2026. Aprende a instrumentar aplicaciones LLM con traces de prompts, embeddings y tool calls, crear dashboards para latency y cost, diseñar estrategias de alerting, implementar monitoring AI-específico (calidad de prompts, uso de tokens, model drift) y debuggear issues de producción como hallucinations y cost spikes. Integración con LangSmith y backends de monitoring.
64 lecciones
Guía de SQL Avanzado para Consulta
Aprende a consultar una base de datos relacional con SQL de verdad: JOINs a fondo, agregación, subconsultas, CTEs (incluidas las recursivas), window functions y optimización de consultas leyendo el plan de ejecución. Trabajas sobre la base de datos de Reservo, un sistema de reservas de salas de coworking, y sales sabiendo responder preguntas de negocio complejas con una sola consulta bien escrita, legible y eficiente. Cierra con un reporte analítico completo: ingreso por sala y por mes, top socios por gasto, ocupación, tasa de reembolso y ranking.
64 lecciones
Guía de Terraform e IaC
Toma el stack de Andes Cargo que en la Guía de Servicios Core de AWS se creó a mano, comando por comando, y le enseña a dejar de crear infraestructura a mano para empezar a declararla. La guía cubre HCL en profundidad (`resource`, `data`, `variable`, `output`, `locals`, `module`), el ciclo `init`/`plan`/`apply`/`destroy` y la idempotencia que lo sostiene, y dedica el módulo de mayor peso al `state` de Terraform: qué es, por qué es la fuente de verdad, cómo se detecta el drift, cómo se importa infraestructura que ya existe (el mismo problema real de Andes Cargo, creada a mano en la guía anterior) y por qué un state mal resguardado es uno de los riesgos de seguridad menos enseñados de la disciplina. Construye dos módulos reutilizables (`s3-bucket`, `iam-role`) y los usa para declarar los mismos cuatro recursos canónicos de Andes Cargo — el bucket, los dos roles IAM y la función Lambda con su tabla DynamoDB — probando que un solo `terraform apply` recrea lo que antes exigía un checklist manual, y que un solo `terraform destroy` lo limpia todo. El capstone corre el mismo código con OpenTofu, el fork open source de Terraform, y dedica una lección al incidente real de marzo de 2026 donde un agente de IA corrió un `terraform destroy` contra infraestructura de producción sin que nadie revisara el `plan` con atención — instalando la regla de que ningún `apply` ni `destroy` corre sin leer el plan completo primero. Todo corre $0 contra el mismo laboratorio LocalStack de la guía anterior.
64 lecciones
Guía de Servicios Core de AWS
Entra a AWS desde cero y arma, con tus propias manos, una arquitectura real de punta a punta — sin poner una tarjeta de crédito. La guía usa el caso de Andes Cargo, una empresa de logística LATAM que necesita mover sus manifiestos de envío y su tracking de inventario de una laptop a la nube, y con ese hilo construye el modelo mental de "la nube" (servicio gestionado, responsabilidad compartida, regiones y zonas de disponibilidad) y los cuatro servicios que sostienen el 80% de lo que se construye en AWS: IAM (identidad y mínimo privilegio), S3 (almacenamiento de objetos), EC2 + VPC (cómputo y la red mínima) y Lambda + DynamoDB (procesamiento por eventos y base de datos NoSQL). Todo corre contra LocalStack, el emulador que replica la API real de AWS en Docker, así que cada comando es el mismo `aws`/`awslocal` que se usaría en una cuenta real, con salidas JSON literales y verificadas. El hilo es acumulativo: la VPC del módulo 2 sostiene la instancia EC2 del módulo 5, los roles IAM del módulo 3 se adjuntan a Lambda y a EC2, el bucket S3 del módulo 4 dispara la función Lambda del módulo 6, que escribe en la tabla DynamoDB del módulo 7 — y el capstone del módulo 8 corre ese flujo completo, de la subida de un archivo a la consulta final, con evidencia ejecutada de cada paso. Es la guía que abre el ecosistema AWS Cloud: no enseña Terraform, contenedores, Kubernetes, CI/CD, SRE ni seguridad multi-cuenta — construye el cimiento sobre el que esas guías hermanas profundizan.
64 lecciones
Guía de Despliegue y Diseño de Sistemas
Lleva tu API Python de localhost a producción en cloud platforms reales (Render, Railway, Fly.io), configura managed databases (Supabase, Neon), Redis en la nube (Upstash), reverse proxy con Nginx, y domina fundamentos de System Design: monolith vs microservices, caching layers, message queues, scaling strategies, y API versioning. Guía #15 y ÚLTIMA del Backend Python Developer con FastAPI Path — el capstone que cierra todo el path.
56 lecciones
Guía de Optimización de Costos y Caché
Domina la reducción de costos en sistemas AI: entiende los drivers de costo (tokens, llamadas API, embeddings), implementa Redis caching y semantic caching (queries similares = respuestas cacheadas usando embeddings), aplica optimización de prompts y estrategias de selección de modelos, y construye un sistema que logra 50-80% de reducción de costos con números reales. La única guía en español que cubre semantic caching con hands-on.
64 lecciones
Guía de Inglés Técnico y Empleabilidad
Aprende a trabajar y postularte en inglés: lee documentación sin traducir, escribe PRs, bug reports y documentos de diseño en inglés llano, sostén un standup y una demo en voz alta, y ejecuta una búsqueda de empleo con criterio de mercado. Los siete módulos parten de tu objetivo real —el puesto, el mercado y la brecha de inglés que te separan de él— y avanzan por los fundamentos de leer y escuchar inglés técnico, la comunicación escrita asíncrona (chat, issues, PRs, commits), la escritura de documentos técnicos en lenguaje llano (design docs, ADRs, READMEs, postmortems), el inglés técnico hablado (standups, reuniones, pair programming, demos), tus materiales profesionales (CV apto para ATS, LinkedIn, portafolio) y el proceso de contratación completo. El proyecto final es el Employability Kit: un dossier acumulativo y defendible en entrevista, con la ficha de objetivo, el portafolio con design doc y ADR, el paquete de comunicación asíncrona, el CV adaptado y tres grabaciones en inglés sin guion —pitch, demo y simulacro de entrevista.
56 lecciones