GuíaAvanzado
Guía de Seguridad y Sandboxing de Agentes
Aprende a hacer seguro un agente que toma acciones con herramientas (tools) reales sobre un sistema. Esta guía cubre el modelo de amenaza de un agente, la inyección de prompt directa e indirecta, el contrato de herramientas y el mínimo privilegio, el sandboxing de la ejecución de herramientas, los modelos de permiso y el human-in-the-loop, los guardrails de entrada y salida, y el manejo de secretos y el radio de explosión. El caso que acompaña toda la guía es un agente de Reservo (un backend de reservas de salas de coworking) con herramientas como `search_rooms`, `book_room` y `cancel_booking`. Sales sabiendo diseñar un agente que no puede ser manipulado para causar daño ni fugar datos, aunque el modelo o la entrada del usuario sean hostiles. Toda la ingeniería de seguridad —el validador de herramientas, el sandbox, la puerta de permisos, los guardrails, el log de auditoría y la demo de inyección con su defensa— se ejecuta de verdad con Python 3.14 (stdlib); la decisión del LLM se presenta como concepto, con ejemplos realistas.
- 64
- lecciones
- 8
- módulos
- Inglés · Español
- disponible en
- Sí
- certificado
- Gratis
- acceso
Resultados
Lo que vas a poder hacer
- Entender por qué un agente con herramientas es una superficie de ataque nueva, usando el marco OWASP LLM Top 10 (inyección de prompt, manejo inseguro de la salida, agencia excesiva)
- Defenderte de la inyección de prompt directa e indirecta, tratando toda salida de herramienta y todo dato externo como no confiable, nunca como una orden
- Diseñar el contrato de cada herramienta con mínimo privilegio: qué recibe, qué devuelve, y una allowlist de acciones que rechaza lo no permitido
- Aislar la ejecución de una herramienta con sandboxing: un `subprocess` confinado con límites de recursos, timeout, sin red y un directorio temporal
- Implementar modelos de permiso y human-in-the-loop: auto-permitir lo seguro, pedir confirmación para lo riesgoso, prohibir lo peligroso, con un log de auditoría de cada llamada
- Construir guardrails de entrada y salida: validar los argumentos que el agente pasa a una herramienta y sanear lo que una herramienta devuelve antes de que reingrese al contexto
- Manejar secretos con credenciales de alcance mínimo por herramienta y limitar el radio de explosión de un agente comprometido
- Endurecer un agente completo en el proyecto final y validarlo con una prueba de red-team —una batería de ataques ejecutada— que las defensas bloquean
Antes de empezar
Qué necesitas traer
Es para ti si...
- Devs construyendo un agente con herramientas que necesitan asegurar que un input hostil no se convierta en una acción destructiva
- Equipos evaluando cómo dar autonomía a un agente sin exponer credenciales, datos o acciones irreversibles
- Devs que ya conocen los fundamentos de agentes y quieren la rebanada específica de seguridad, no otro curso general de agentes
- Ingenieros preparándose para preguntas de entrevista sobre seguridad de agentes de IA: inyección de prompt, agencia excesiva, sandboxing
Requisitos y materiales
- Python 3.14 y conocimiento básico de agentes con tool calling
- No hace falta haber construido un agente completo antes, pero ayuda conocer el ecosistema de ingeniería agéntica
- No hay llamadas reales a la API de ningún LLM en esta guía: toda la ingeniería de seguridad se ejecuta con Python stdlib
Contenido
El temario, módulo por módulo
Abre cualquiera para ver sus lecciones.
- Módulo 1: Por qué la seguridad de agentes
- De hablar a actuar: por qué un agente con herramientas es peligroso
- El modelo de amenaza de un agente
- Agencia excesiva
- El OWASP LLM Top 10 como marco
- En qué se diferencia de la seguridad de apps clásica
- Anatomía de un incidente: cómo se encadena un ataque de agente
- Mini-proyecto: un agente de Reservo vulnerable
- Introducción al Módulo 2: Inyección de prompt
- Qué es la inyección de prompt
- Inyección directa: cuando el atacante es el usuario
- Inyección indirecta: el dato envenenado
- Por qué el LLM no separa instrucciones de datos
- Defensas de prompt: delimitadores y jerarquía de instrucciones
- Por qué ninguna defensa de prompt basta: hay que limitar la agencia
- Mini-proyecto: inyecta y defiende
- Introducción al Módulo 3: el contrato de herramientas y el mínimo privilegio
- El contrato de un tool y su JSON Schema
- Mínimo privilegio: solo los tools necesarios
- Tools acotados vs un tool demasiado poderoso
- Separar lectura de escritura y marcar lo destructivo
- El allowlist de tools y el despacho seguro
- Diseñar un tool seguro: acotar `run_query`
- Mini-proyecto: un registry de mínimo privilegio
- Introducción al Módulo 4: sandboxing de la ejecución de herramientas
- Por qué confinar la ejecución de un tool
- Subprocess: aislar del proceso del agente
- Límites con `resource`: CPU y memoria
- El timeout que mata un proceso colgado
- Sin red y un directorio temporal aislado
- Qué protege y qué NO un sandbox
- Mini-proyecto: un code tool con sandbox
- Introducción al Módulo 5: modelos de permiso y human-in-the-loop
- No todas las acciones son iguales: reversible vs destructivo
- Los tres niveles: auto / ask / deny
- Human-in-the-loop: la puerta de aprobación
- Permisos por capacidad, no acceso ambiental
- El audit log de cada tool call
- Diseñar la política de permisos de un agente
- Mini-proyecto: un agente con puerta de permisos
- Introducción al Módulo 6: guardrails de entrada y salida
- Validar las entradas de dominio del tool
- La salida de tool como dato no confiable
- Redactar secretos y PII de las salidas
- Límites de tamaño y filas de la salida
- Rate limiting de tool calls
- Componer los guardrails de entrada y salida en una capa
- Mini-proyecto: guardrails de entrada/salida para Reservo
- Introducción al Módulo 7: secretos, aislamiento y radio de explosión
- Secretos fuera del prompt: el modelo nunca los ve
- Credenciales de alcance mínimo por tool
- Aislamiento de red y allowlist de hosts
- El radio de explosión y cómo reducirlo
- Defensa en profundidad: las capas juntas
- Monitoreo y detección de anomalías sobre el audit log
- Mini-proyecto: encoge el radio de explosión
- Introducción al Módulo 8: endurece un agente con herramientas
- El modelo de amenaza y las defensas de inyección
- Tools de mínimo privilegio + allowlist
- Ejecución sandboxed
- HITL + permisos + audit log
- Guardrails de entrada y salida
- Secretos + detección de anomalías
- Proyecto: endurece un agente con herramientas
Dudas frecuentes
Lo que suele preguntarse
Sin límite. Es una guía gratuita: entras cuando quieras, las veces que quieras.
No. Los módulos están ordenados de menos a más, pero puedes saltar al que necesites. Tu progreso se guarda por lección.
Lo que haga falta está en «Qué necesitas traer», arriba. Si no aparece nada ahí, puedes empezar desde cero.
En el grupo de WhatsApp del Club, y cada quince días hay un live con un instructor donde se resuelven dudas en vivo.
Sí. Al terminar todas las lecciones se emite automáticamente, con un código verificable que puedes compartir en LinkedIn.
Empieza cuando quieras
Lo que dicen los estudiantes
Estas reseñas son de estudiantes inscritos que completaron al menos el 50% del curso. Moderamos las reseñas solo por motivos de contenido (spam, lenguaje ofensivo, datos personales), nunca por ser críticas o negativas.
Aún no hay reseñas aprobadas.
¡Sé el primero en compartir tu experiencia!