GuíaIntermedio
Guía de SRE y Respuesta a Incidentes
Opera, con la disciplina de SRE, todo lo que las seis guías anteriores del ecosistema AWS Cloud ya construyeron sobre Andes Cargo: un sistema puede pasar el security gate y el cost gate y seguir fallando en producción, porque "confiable" no es un estado, es una medición. Esta guía enseña la matemática real de SLI/SLO/error budget con una calculadora en Python que corre de verdad, primero sobre datos fijos y después sobre métricas reales del Lambda de Andes Cargo leídas con CloudWatch, Prometheus, Grafana y trazas de Jaeger vía OpenTelemetry — observabilidad tratada como el insumo de esa matemática, no como una disciplina de instrumentación completa. Construye alerting basado en la tasa de consumo del error budget (burn rate multi-ventana, el patrón real de Google SRE) en vez de umbrales sueltos, y arma el ciclo de vida completo de un incidente con roles, niveles de severidad y una rotación de on-call diseñada con honestidad sobre su costo humano. Al centro de la guía, opera de punta a punta el incidente real Claude Code `destroy` que las tres guías anteriores del ecosistema ya usaron como advertencia: aquí se reconstruye su timeline, se clasifica su severidad, se declara y se mitiga con el marco recién construido, y se cierra con un postmortem sin culpa siguiendo la plantilla real de Google SRE y un runbook operativo verificado contra LocalStack. El capstone corre un incidente sintético nuevo, determinista, a través de la máquina completa.
- 64
- lecciones
- 8
- módulos
- Inglés · Español
- disponible en
- Sí
- certificado
- Gratis
- acceso
Resultados
Lo que vas a poder hacer
- Explicar qué es SRE y por qué la confiabilidad es una medición, no un estado — el costo marginal de cada nueve adicional de disponibilidad
- Calcular un SLI real (eventos buenos ÷ eventos válidos), elegir un SLO que signifique algo, y obtener el error budget en minutos con una calculadora Python ejecutable
- Instrumentar métricas, logs y trazas como insumo directo de un SLI — CloudWatch, Prometheus, Grafana y trazas con OpenTelemetry y Jaeger, corriendo de verdad contra el Lambda heredado de Andes Cargo
- Construir *alerting* basado en tasa de consumo del error budget (*burn rate* multi-ventana, multi-tasa), con una regla real en Alertmanager y una alarma real de CloudWatch
- Diseñar el ciclo de vida completo de un incidente: severidades, roles (*incident commander*, comunicación, operaciones) y una rotación de on-call determinista, con honestidad sobre su costo humano real
- Operar el incidente Claude Code `destroy` de punta a punta: reconstruir su timeline, clasificar su severidad, declararlo, y trazar el árbol de decisión de mitigación que en la vida real llevó a la recuperación
- Escribir un postmortem sin culpa siguiendo la plantilla real de Google SRE, con *action items* que de verdad se cumplen, y construir el primer runbook operativo de Andes Cargo verificado paso a paso contra LocalStack
- Correr, como capstone, un incidente sintético determinista a través de la máquina completa: SLI → dato real → alerta de *burn rate* → incidente declarado → runbook → postmortem
Antes de empezar
Qué necesitas traer
Es para ti si...
- Backend, DevOps o Cloud engineers que ya completaron las seis guías anteriores del ecosistema AWS Cloud (Servicios Core, Serverless y Contenedores, Terraform e IaC, CI/CD y GitOps, Seguridad Cloud, FinOps) y quieren operar la confiabilidad de lo que construyeron
- Equipos con un pipeline verde, seguro y presupuestado que nunca definió qué significa "confiable" en números
- Ingenieros que se preparan para roles con guardia (on-call) y necesitan el vocabulario real de SLI/SLO/error budget, no solo la definición de diccionario
- Devs que buscan un ejemplo real y completo de postmortem sin culpa y de runbook operativo, algo que casi ningún temario de mercado cubre
Requisitos y materiales
- Las seis guías anteriores del ecosistema AWS Cloud completadas (o equivalente): `andes-cargo-infra/` aplicado, con el pipeline de GitHub Actions, el security gate y el cost gate ya funcionando
- Docker y `docker compose` instalados y operativos, para levantar Prometheus, Grafana, Alertmanager y Jaeger
- Python básico (la calculadora de error budget y el evaluador de *burn rate* son scripts cortos)
- LocalStack (plan Hobby gratuito) para CloudWatch, DynamoDB y Lambda
Contenido
El temario, módulo por módulo
Abre cualquiera para ver sus lecciones.
- 1. Introducción a la guía: de "funciona, es seguro, cabe en el presupuesto" a "es confiable"
- 2. Qué es SRE (y qué no es)
- 3. Confiabilidad como feature, no como accidente
- 4. Manos a la obra: leyendo Andes Cargo como lo leería un SRE
- 5. Dos incidentes reales, dos preguntas distintas
- 6. Manos a la obra: el error budget que el incidente Claude Code se comió
- 7. El vocabulario que vas a usar toda la guía
- 8. Proyecto: la carta de confiabilidad de Andes Cargo
- 1. Introducción: del vocabulario a la matemática
- 2. Eligiendo un buen SLI: las cuatro señales doradas
- 3. Manos a la obra: tu primera definición de SLI
- 4. Manos a la obra: la calculadora de error budget
- 5. Eligiendo un SLO que signifique algo
- 6. Manos a la obra: *burn rate* — la tasa de consumo, no solo el saldo
- 7. Manos a la obra: aplicando la calculadora a un escenario real de Andes Cargo
- 8. Proyecto: `SLO.md` de Andes Cargo
- 1. Introducción: observabilidad al servicio de una pregunta, no de un dashboard
- 2. Los tres pilares, con el lente de SRE
- 3. Manos a la obra: métricas reales del Lambda heredado
- 4. Manos a la obra: logs reales con `jq`
- 5. Manos a la obra: trazas con OpenTelemetry y Jaeger
- 6. Manos a la obra: Prometheus y Grafana, el stack que pide el mercado
- 7. De telemetría cruda a un SLI medido
- 8. Proyecto: el pipeline de observabilidad-a-SLI de Andes Cargo
- 1. Introducción: por qué un umbral estático no alcanza
- 2. *Burn rate* multi-ventana, multi-tasa: el patrón real de Google SRE
- 3. Manos a la obra: el evaluador de *burn rate*
- 4. Manos a la obra: la regla real en Alertmanager
- 5. Manos a la obra: una alarma real de CloudWatch sobre el Lambda
- 6. Lo que AWS ya automatiza: CloudWatch Application Signals, nombrado
- 7. Manos a la obra: enrutando la alerta
- 8. Proyecto: la política de *alerting* de Andes Cargo
- 1. Introducción: el marco antes del caso
- 2. El ciclo de vida de un incidente
- 3. Niveles de severidad, con ejemplos reales de Andes Cargo
- 4. Roles durante un incidente
- 5. Manos a la obra: la matriz de severidad de Andes Cargo
- 6. On-call, con honestidad sobre su costo
- 7. Manos a la obra: una rotación de on-call determinista
- 8. Proyecto: `INCIDENT-RESPONSE-PLAN.md` de Andes Cargo
- 1. Introducción: operar, no volver a narrar
- 2. Manos a la obra: reconstruyendo el timeline exacto
- 3. Manos a la obra: clasificando la severidad
- 4. Manos a la obra: declarando el incidente
- 5. Comunicación durante un incidente: interna frente a externa
- 6. Manos a la obra: el árbol de decisión de mitigación
- 7. El error budget de este incidente, con el vocabulario completo
- 8. Proyecto: `TIMELINE.md` final de Andes Cargo para este caso
- 1. Introducción: del timeline al aprendizaje sistémico
- 2. Qué hace a un postmortem "sin culpa"
- 3. Manos a la obra: escribiendo el postmortem del incidente Claude Code
- 4. *Action items* que de verdad se cumplen
- 5. Qué es (y qué no es) un runbook
- 6. Manos a la obra: el primer runbook real de Andes Cargo
- 7. Manos a la obra: el intento honesto de backup/restore
- 8. Proyecto: el paquete de postmortem y runbooks de Andes Cargo
- 1. Introducción al capstone
- 2. Repaso de arquitectura: la máquina de confiabilidad completa
- 3. Manos a la obra: introduciendo un incidente sintético determinista
- 4. Recorrido end-to-end: la alerta dispara, el incidente se declara
- 5. Recorrido end-to-end: el runbook mitiga, el postmortem cierra
- 6. Lo que esta guía dejó representativo, honestidad final
- 7. Lo que Andes Cargo todavía necesita
- 8. Proyecto final: el paquete de confiabilidad de Andes Cargo como entregable
Dudas frecuentes
Lo que suele preguntarse
Sin límite. Es una guía gratuita: entras cuando quieras, las veces que quieras.
No. Los módulos están ordenados de menos a más, pero puedes saltar al que necesites. Tu progreso se guarda por lección.
Lo que haga falta está en «Qué necesitas traer», arriba. Si no aparece nada ahí, puedes empezar desde cero.
En el grupo de WhatsApp del Club, y cada quince días hay un live con un instructor donde se resuelven dudas en vivo.
Sí. Al terminar todas las lecciones se emite automáticamente, con un código verificable que puedes compartir en LinkedIn.
Empieza cuando quieras
Lo que dicen los estudiantes
Estas reseñas son de estudiantes inscritos que completaron al menos el 50% del curso. Moderamos las reseñas solo por motivos de contenido (spam, lenguaje ofensivo, datos personales), nunca por ser críticas o negativas.
Aún no hay reseñas aprobadas.
¡Sé el primero en compartir tu experiencia!