GuíaIntermedio

Guía de SRE y Respuesta a Incidentes

Opera, con la disciplina de SRE, todo lo que las seis guías anteriores del ecosistema AWS Cloud ya construyeron sobre Andes Cargo: un sistema puede pasar el security gate y el cost gate y seguir fallando en producción, porque "confiable" no es un estado, es una medición. Esta guía enseña la matemática real de SLI/SLO/error budget con una calculadora en Python que corre de verdad, primero sobre datos fijos y después sobre métricas reales del Lambda de Andes Cargo leídas con CloudWatch, Prometheus, Grafana y trazas de Jaeger vía OpenTelemetry — observabilidad tratada como el insumo de esa matemática, no como una disciplina de instrumentación completa. Construye alerting basado en la tasa de consumo del error budget (burn rate multi-ventana, el patrón real de Google SRE) en vez de umbrales sueltos, y arma el ciclo de vida completo de un incidente con roles, niveles de severidad y una rotación de on-call diseñada con honestidad sobre su costo humano. Al centro de la guía, opera de punta a punta el incidente real Claude Code `destroy` que las tres guías anteriores del ecosistema ya usaron como advertencia: aquí se reconstruye su timeline, se clasifica su severidad, se declara y se mitiga con el marco recién construido, y se cierra con un postmortem sin culpa siguiendo la plantilla real de Google SRE y un runbook operativo verificado contra LocalStack. El capstone corre un incidente sintético nuevo, determinista, a través de la máquina completa.

64
lecciones
8
módulos
Inglés · Español
disponible en
certificado
Gratis
acceso
NIEVA

Resultados

Lo que vas a poder hacer

  • Explicar qué es SRE y por qué la confiabilidad es una medición, no un estado — el costo marginal de cada nueve adicional de disponibilidad
  • Calcular un SLI real (eventos buenos ÷ eventos válidos), elegir un SLO que signifique algo, y obtener el error budget en minutos con una calculadora Python ejecutable
  • Instrumentar métricas, logs y trazas como insumo directo de un SLI — CloudWatch, Prometheus, Grafana y trazas con OpenTelemetry y Jaeger, corriendo de verdad contra el Lambda heredado de Andes Cargo
  • Construir *alerting* basado en tasa de consumo del error budget (*burn rate* multi-ventana, multi-tasa), con una regla real en Alertmanager y una alarma real de CloudWatch
  • Diseñar el ciclo de vida completo de un incidente: severidades, roles (*incident commander*, comunicación, operaciones) y una rotación de on-call determinista, con honestidad sobre su costo humano real
  • Operar el incidente Claude Code `destroy` de punta a punta: reconstruir su timeline, clasificar su severidad, declararlo, y trazar el árbol de decisión de mitigación que en la vida real llevó a la recuperación
  • Escribir un postmortem sin culpa siguiendo la plantilla real de Google SRE, con *action items* que de verdad se cumplen, y construir el primer runbook operativo de Andes Cargo verificado paso a paso contra LocalStack
  • Correr, como capstone, un incidente sintético determinista a través de la máquina completa: SLI → dato real → alerta de *burn rate* → incidente declarado → runbook → postmortem

Antes de empezar

Qué necesitas traer

Es para ti si...

  • Backend, DevOps o Cloud engineers que ya completaron las seis guías anteriores del ecosistema AWS Cloud (Servicios Core, Serverless y Contenedores, Terraform e IaC, CI/CD y GitOps, Seguridad Cloud, FinOps) y quieren operar la confiabilidad de lo que construyeron
  • Equipos con un pipeline verde, seguro y presupuestado que nunca definió qué significa "confiable" en números
  • Ingenieros que se preparan para roles con guardia (on-call) y necesitan el vocabulario real de SLI/SLO/error budget, no solo la definición de diccionario
  • Devs que buscan un ejemplo real y completo de postmortem sin culpa y de runbook operativo, algo que casi ningún temario de mercado cubre

Requisitos y materiales

  • Las seis guías anteriores del ecosistema AWS Cloud completadas (o equivalente): `andes-cargo-infra/` aplicado, con el pipeline de GitHub Actions, el security gate y el cost gate ya funcionando
  • Docker y `docker compose` instalados y operativos, para levantar Prometheus, Grafana, Alertmanager y Jaeger
  • Python básico (la calculadora de error budget y el evaluador de *burn rate* son scripts cortos)
  • LocalStack (plan Hobby gratuito) para CloudWatch, DynamoDB y Lambda

Contenido

El temario, módulo por módulo

Abre cualquiera para ver sus lecciones.

Dudas frecuentes

Lo que suele preguntarse

Empieza cuando quieras

Reseñas

Lo que dicen los estudiantes

Estas reseñas son de estudiantes inscritos que completaron al menos el 50% del curso. Moderamos las reseñas solo por motivos de contenido (spam, lenguaje ofensivo, datos personales), nunca por ser críticas o negativas.

Aún no hay reseñas aprobadas.

¡Sé el primero en compartir tu experiencia!