GuíaAvanzado

Guía de Seguridad y Sandboxing de Agentes

Aprende a hacer seguro un agente que toma acciones con herramientas (tools) reales sobre un sistema. Esta guía cubre el modelo de amenaza de un agente, la inyección de prompt directa e indirecta, el contrato de herramientas y el mínimo privilegio, el sandboxing de la ejecución de herramientas, los modelos de permiso y el human-in-the-loop, los guardrails de entrada y salida, y el manejo de secretos y el radio de explosión. El caso que acompaña toda la guía es un agente de Reservo (un backend de reservas de salas de coworking) con herramientas como `search_rooms`, `book_room` y `cancel_booking`. Sales sabiendo diseñar un agente que no puede ser manipulado para causar daño ni fugar datos, aunque el modelo o la entrada del usuario sean hostiles. Toda la ingeniería de seguridad —el validador de herramientas, el sandbox, la puerta de permisos, los guardrails, el log de auditoría y la demo de inyección con su defensa— se ejecuta de verdad con Python 3.14 (stdlib); la decisión del LLM se presenta como concepto, con ejemplos realistas.

64
lecciones
8
módulos
Inglés · Español
disponible en
certificado
Gratis
acceso
NIEVA

Resultados

Lo que vas a poder hacer

  • Entender por qué un agente con herramientas es una superficie de ataque nueva, usando el marco OWASP LLM Top 10 (inyección de prompt, manejo inseguro de la salida, agencia excesiva)
  • Defenderte de la inyección de prompt directa e indirecta, tratando toda salida de herramienta y todo dato externo como no confiable, nunca como una orden
  • Diseñar el contrato de cada herramienta con mínimo privilegio: qué recibe, qué devuelve, y una allowlist de acciones que rechaza lo no permitido
  • Aislar la ejecución de una herramienta con sandboxing: un `subprocess` confinado con límites de recursos, timeout, sin red y un directorio temporal
  • Implementar modelos de permiso y human-in-the-loop: auto-permitir lo seguro, pedir confirmación para lo riesgoso, prohibir lo peligroso, con un log de auditoría de cada llamada
  • Construir guardrails de entrada y salida: validar los argumentos que el agente pasa a una herramienta y sanear lo que una herramienta devuelve antes de que reingrese al contexto
  • Manejar secretos con credenciales de alcance mínimo por herramienta y limitar el radio de explosión de un agente comprometido
  • Endurecer un agente completo en el proyecto final y validarlo con una prueba de red-team —una batería de ataques ejecutada— que las defensas bloquean

Antes de empezar

Qué necesitas traer

Es para ti si...

  • Devs construyendo un agente con herramientas que necesitan asegurar que un input hostil no se convierta en una acción destructiva
  • Equipos evaluando cómo dar autonomía a un agente sin exponer credenciales, datos o acciones irreversibles
  • Devs que ya conocen los fundamentos de agentes y quieren la rebanada específica de seguridad, no otro curso general de agentes
  • Ingenieros preparándose para preguntas de entrevista sobre seguridad de agentes de IA: inyección de prompt, agencia excesiva, sandboxing

Requisitos y materiales

  • Python 3.14 y conocimiento básico de agentes con tool calling
  • No hace falta haber construido un agente completo antes, pero ayuda conocer el ecosistema de ingeniería agéntica
  • No hay llamadas reales a la API de ningún LLM en esta guía: toda la ingeniería de seguridad se ejecuta con Python stdlib

Contenido

El temario, módulo por módulo

Abre cualquiera para ver sus lecciones.

Dudas frecuentes

Lo que suele preguntarse

Empieza cuando quieras

Reseñas

Lo que dicen los estudiantes

Estas reseñas son de estudiantes inscritos que completaron al menos el 50% del curso. Moderamos las reseñas solo por motivos de contenido (spam, lenguaje ofensivo, datos personales), nunca por ser críticas o negativas.

Aún no hay reseñas aprobadas.

¡Sé el primero en compartir tu experiencia!