Respuesta directa: la seguridad de agentes de IA depende menos de que el modelo «se porte bien» y más de limitar lo que puede leer, decidir y ejecutar. Los controles esenciales son identidad separada, mínimo privilegio, aprobación humana para acciones sensibles, aislamiento del contenido externo, límites de gasto y actividad, registros, pruebas y un mecanismo de parada.
Última revisión: 12 de agosto de 2026. Esta guía defensiva se apoya en el OWASP Top 10 for Agentic Applications 2026 y el AI Risk Management Framework de NIST. No incluye instrucciones ofensivas ni sustituye una auditoría de seguridad.
Seguridad de agentes de IA: por qué exigen más controles que un chatbot
Un chatbot tradicional genera una respuesta. Un agente puede encadenar pasos, consultar datos, llamar a herramientas y modificar sistemas. Esa capacidad amplía la superficie de ataque: una salida incorrecta deja de ser solo texto y puede convertirse en un correo enviado, un archivo borrado, un permiso concedido o un pago iniciado.
OWASP publicó en diciembre de 2025 su Top 10 para aplicaciones agénticas de 2026. El marco incluye riesgos como secuestro del objetivo del agente, uso indebido de herramientas, abuso de identidad y privilegios, problemas en la cadena de suministro, envenenamiento de memoria, comunicación insegura entre agentes y fallos en cascada. La inyección de instrucciones es importante, pero no es el único riesgo.
Inyección indirecta y seguridad de agentes de IA
Una inyección directa llega en la instrucción de un usuario. La indirecta aparece dentro de contenido que el agente procesa: una web, un correo, un PDF, un documento compartido o la salida de otra herramienta. Ese contenido puede intentar modificar el objetivo, solicitar secretos o inducir una acción no prevista.
Los modelos no separan de forma perfecta las instrucciones fiables de los datos no fiables. Los filtros ayudan, pero no justifican conceder permisos amplios. La mitigación más sólida combina varias capas: tratar el contenido externo como no confiable, reducir herramientas disponibles, validar parámetros, exigir aprobación y limitar el impacto máximo.
Una inyección no necesita «controlar por completo» el agente para causar problemas. Basta con desviar una búsqueda, contaminar una memoria, elegir una herramienta incorrecta o persuadir a la persona que supervisa. Por eso la seguridad debe diseñarse para que un fallo aislado no alcance activos críticos.
10 controles de seguridad para agentes de IA
1. Identidad propia para cada agente
No conectes el agente con la cuenta personal de un administrador. Usa una identidad de servicio separada, reconocible y revocable. Así puedes atribuir acciones, rotar credenciales y desactivar un agente sin bloquear a una persona.
2. Mínimo privilegio por tarea
Concede solo las herramientas, carpetas, tablas y operaciones necesarias. Prioriza lectura frente a escritura. Si un agente resume facturas, no necesita aprobarlas ni pagarlas. Revisa los permisos de forma periódica y elimina los que ya no se utilizan.
3. Credenciales de corta duración y alcance limitado
Evita contraseñas maestras y secretos incrustados en prompts. Utiliza tokens con ámbito limitado, caducidad, rotación y revocación. Los secretos deben permanecer en un gestor de credenciales y entregarse a la herramienta en tiempo de ejecución, no al modelo como texto.
4. Aprobación humana para acciones de alto impacto
Pagos, borrados, cambios de permisos, publicación pública, contratos o comunicaciones masivas deben detenerse ante una persona autorizada. La pantalla de aprobación debe mostrar la acción concreta, el destino y los datos relevantes; un botón genérico de «continuar» no es supervisión efectiva.
5. Separar contenido no confiable de instrucciones
Marca el origen de páginas, correos y archivos externos. Cuando el agente procese ese material, reduce temporalmente sus herramientas y prohíbe que el contenido cambie políticas, revele secretos o autorice acciones. No permitas que una página web dicte directamente parámetros de una herramienta sensible.
6. Validar cada llamada a herramientas
El backend debe comprobar tipos, destinos, rutas, importes, dominios y reglas de negocio. No confíes en que el modelo produzca siempre parámetros seguros. Usa listas permitidas estrechas donde tengan sentido, pero evita listas tan amplias que una combinación de acciones produzca un resultado no previsto.
7. Límites de uso y de impacto
Define máximos por operación y por periodo: importe, número de correos, archivos modificados, llamadas a API, tokens, tiempo de ejecución y profundidad de los pasos. Añade alertas y cortacircuitos cuando el comportamiento se desvíe de lo esperado.
8. Registros auditables y protección de datos
Registra qué identidad actuó, qué herramienta se llamó, cuándo, con qué parámetros aprobados y cuál fue el resultado. No hace falta conservar razonamientos internos del modelo. Evita incluir contraseñas, tokens o datos personales innecesarios y define plazos de retención.
9. Pruebas antes y después del despliegue
Prueba instrucciones maliciosas, archivos manipulados, datos incompletos, respuestas duplicadas, herramientas caídas y límites de actividad. Repite las pruebas cuando cambie el modelo, el prompt, una integración o los permisos. NIST recomienda gestionar el riesgo durante todo el ciclo de vida, no solo antes del lanzamiento.
10. Parada, revocación y respuesta a incidentes
Debes poder desactivar el agente, revocar sus credenciales y detener tareas en curso. Define quién toma esa decisión, cómo se preservan pruebas, qué sistemas se revisan y cuándo se notifica a clientes o autoridades. Ensaya el procedimiento antes de necesitarlo.
Matriz de permisos para la seguridad de agentes de IA
| Acción | Configuración recomendada | Control adicional |
|---|---|---|
| Consultar documentos internos | Solo lectura y acceso por carpeta | Registro y filtrado de datos sensibles |
| Enviar un correo individual | Borrador por defecto | Aprobación del destinatario y contenido |
| Modificar un CRM | Campos y objetos permitidos | Validación y posibilidad de reversión |
| Ejecutar código | Entorno aislado, sin secretos | Límites de red, CPU, memoria y tiempo |
| Iniciar pagos o compras | Sin ejecución autónoma | Aprobación fuerte, límites y doble control |
Seguridad de agentes en navegador, n8n y MCP
Agentes que navegan por la web
Están expuestos continuamente a contenido externo. Usa un perfil de navegador separado, evita sesiones administrativas, restringe descargas y dominios, y exige aprobación antes de publicar, comprar, enviar o cambiar configuraciones. Una pestaña no confiable no debe poder acceder a secretos de otra aplicación.
Automatizaciones con n8n
Separa credenciales por flujo y entorno, limita el alcance de cada conexión, valida los datos antes de nodos con efectos y conserva ejecuciones suficientes para investigar incidentes. Consulta el tutorial de n8n en español para entender el flujo y aplica estos controles antes de producción.
Servidores MCP
Un servidor MCP amplía las capacidades disponibles para el modelo. Trátalo como una integración con privilegios: verifica su origen, revisa las herramientas expuestas, fija versiones, separa entornos y monitoriza cambios. Nuestra guía de MCP explica sus componentes.
Qué no debes asumir
- «El modelo bloquea contenido peligroso»: las salvaguardas son una capa, no un control de autorización.
- «Solo accede a lo que yo puedo ver»: heredar todos los permisos de una persona suele ser excesivo.
- «Hay una aprobación humana»: no sirve si la persona no recibe contexto, no tiene tiempo o aprueba de forma automática.
- «Tenemos logs»: deben ser íntegros, consultables y útiles para reconstruir acciones, sin almacenar secretos.
- «Cumplir el AI Act cubre la ciberseguridad»: el Reglamento se suma a protección de datos, seguridad, contratos y reglas sectoriales.
Relación con el AI Act y la responsabilidad legal
No existe una regla por la que «quien despliega siempre responde». El papel, el uso, el contrato y la causa del daño importan. El AI Act exige medidas concretas solo en determinados supuestos y no sustituye la responsabilidad civil ni la normativa de ciberseguridad.
Consulta la guía actualizada del AI Act para agentes de IA y nuestro análisis de responsabilidad legal por agentes de IA.
Checklist de seguridad de agentes de IA antes de activarlos
- Identidad separada y credenciales revocables.
- Permisos documentados y revisados.
- Acciones sensibles con aprobación contextual.
- Contenido externo tratado como no confiable.
- Validación de parámetros en el backend.
- Límites de uso, coste y velocidad.
- Registros sin secretos y con retención definida.
- Pruebas de abuso y fallo completadas.
- Alertas y responsable de incidentes asignado.
- Parada y revocación ensayadas.
Preguntas frecuentes
¿Un modelo más avanzado elimina la inyección de prompts?
No. Puede reducir determinados ataques, pero no sustituye el aislamiento, la autorización y la validación. Diseña el sistema suponiendo que alguna instrucción maliciosa atravesará las defensas del modelo.
¿Debo guardar todo lo que el agente piensa?
No. Para auditoría importan las entradas relevantes, las herramientas, parámetros, aprobaciones, resultados y cambios. Conserva solo lo necesario y evita secretos o datos personales excesivos.
¿Puedo empezar sin un equipo de seguridad?
Sí, con un caso de bajo impacto, datos de prueba, permisos mínimos y aprobación manual. No empieces por pagos, producción, datos sensibles o decisiones sobre personas sin apoyo especializado.
Fuentes oficiales y técnicas
- OWASP Top 10 for Agentic Applications 2026.
- NIST AI 600-1: perfil de IA generativa.
- NIST AI Risk Management Framework.
- NIST AI RMF Playbook.
- Reglamento (UE) 2024/1689.
Las medidas deben adaptarse al riesgo, los activos, la arquitectura y la normativa aplicable. Para sistemas con datos sensibles, capacidad de ejecutar código, transferir dinero o afectar a personas, solicita una revisión profesional independiente.

