Respuesta directa: la seguridad de agentes de IA depende menos de que el modelo «se porte bien» y más de limitar lo que puede leer, decidir y ejecutar. Los controles esenciales son identidad separada, mínimo privilegio, aprobación humana para acciones sensibles, aislamiento del contenido externo, límites de gasto y actividad, registros, pruebas y un mecanismo de parada.

Última revisión: 12 de agosto de 2026. Esta guía defensiva se apoya en el OWASP Top 10 for Agentic Applications 2026 y el AI Risk Management Framework de NIST. No incluye instrucciones ofensivas ni sustituye una auditoría de seguridad.

Seguridad de agentes de IA: por qué exigen más controles que un chatbot

Un chatbot tradicional genera una respuesta. Un agente puede encadenar pasos, consultar datos, llamar a herramientas y modificar sistemas. Esa capacidad amplía la superficie de ataque: una salida incorrecta deja de ser solo texto y puede convertirse en un correo enviado, un archivo borrado, un permiso concedido o un pago iniciado.

OWASP publicó en diciembre de 2025 su Top 10 para aplicaciones agénticas de 2026. El marco incluye riesgos como secuestro del objetivo del agente, uso indebido de herramientas, abuso de identidad y privilegios, problemas en la cadena de suministro, envenenamiento de memoria, comunicación insegura entre agentes y fallos en cascada. La inyección de instrucciones es importante, pero no es el único riesgo.

Inyección indirecta y seguridad de agentes de IA

Una inyección directa llega en la instrucción de un usuario. La indirecta aparece dentro de contenido que el agente procesa: una web, un correo, un PDF, un documento compartido o la salida de otra herramienta. Ese contenido puede intentar modificar el objetivo, solicitar secretos o inducir una acción no prevista.

Los modelos no separan de forma perfecta las instrucciones fiables de los datos no fiables. Los filtros ayudan, pero no justifican conceder permisos amplios. La mitigación más sólida combina varias capas: tratar el contenido externo como no confiable, reducir herramientas disponibles, validar parámetros, exigir aprobación y limitar el impacto máximo.

Una inyección no necesita «controlar por completo» el agente para causar problemas. Basta con desviar una búsqueda, contaminar una memoria, elegir una herramienta incorrecta o persuadir a la persona que supervisa. Por eso la seguridad debe diseñarse para que un fallo aislado no alcance activos críticos.

10 controles de seguridad para agentes de IA

1. Identidad propia para cada agente

No conectes el agente con la cuenta personal de un administrador. Usa una identidad de servicio separada, reconocible y revocable. Así puedes atribuir acciones, rotar credenciales y desactivar un agente sin bloquear a una persona.

2. Mínimo privilegio por tarea

Concede solo las herramientas, carpetas, tablas y operaciones necesarias. Prioriza lectura frente a escritura. Si un agente resume facturas, no necesita aprobarlas ni pagarlas. Revisa los permisos de forma periódica y elimina los que ya no se utilizan.

3. Credenciales de corta duración y alcance limitado

Evita contraseñas maestras y secretos incrustados en prompts. Utiliza tokens con ámbito limitado, caducidad, rotación y revocación. Los secretos deben permanecer en un gestor de credenciales y entregarse a la herramienta en tiempo de ejecución, no al modelo como texto.

4. Aprobación humana para acciones de alto impacto

Pagos, borrados, cambios de permisos, publicación pública, contratos o comunicaciones masivas deben detenerse ante una persona autorizada. La pantalla de aprobación debe mostrar la acción concreta, el destino y los datos relevantes; un botón genérico de «continuar» no es supervisión efectiva.

5. Separar contenido no confiable de instrucciones

Marca el origen de páginas, correos y archivos externos. Cuando el agente procese ese material, reduce temporalmente sus herramientas y prohíbe que el contenido cambie políticas, revele secretos o autorice acciones. No permitas que una página web dicte directamente parámetros de una herramienta sensible.

6. Validar cada llamada a herramientas

El backend debe comprobar tipos, destinos, rutas, importes, dominios y reglas de negocio. No confíes en que el modelo produzca siempre parámetros seguros. Usa listas permitidas estrechas donde tengan sentido, pero evita listas tan amplias que una combinación de acciones produzca un resultado no previsto.

7. Límites de uso y de impacto

Define máximos por operación y por periodo: importe, número de correos, archivos modificados, llamadas a API, tokens, tiempo de ejecución y profundidad de los pasos. Añade alertas y cortacircuitos cuando el comportamiento se desvíe de lo esperado.

8. Registros auditables y protección de datos

Registra qué identidad actuó, qué herramienta se llamó, cuándo, con qué parámetros aprobados y cuál fue el resultado. No hace falta conservar razonamientos internos del modelo. Evita incluir contraseñas, tokens o datos personales innecesarios y define plazos de retención.

9. Pruebas antes y después del despliegue

Prueba instrucciones maliciosas, archivos manipulados, datos incompletos, respuestas duplicadas, herramientas caídas y límites de actividad. Repite las pruebas cuando cambie el modelo, el prompt, una integración o los permisos. NIST recomienda gestionar el riesgo durante todo el ciclo de vida, no solo antes del lanzamiento.

10. Parada, revocación y respuesta a incidentes

Debes poder desactivar el agente, revocar sus credenciales y detener tareas en curso. Define quién toma esa decisión, cómo se preservan pruebas, qué sistemas se revisan y cuándo se notifica a clientes o autoridades. Ensaya el procedimiento antes de necesitarlo.

Matriz de permisos para la seguridad de agentes de IA

AcciónConfiguración recomendadaControl adicional
Consultar documentos internosSolo lectura y acceso por carpetaRegistro y filtrado de datos sensibles
Enviar un correo individualBorrador por defectoAprobación del destinatario y contenido
Modificar un CRMCampos y objetos permitidosValidación y posibilidad de reversión
Ejecutar códigoEntorno aislado, sin secretosLímites de red, CPU, memoria y tiempo
Iniciar pagos o comprasSin ejecución autónomaAprobación fuerte, límites y doble control

Seguridad de agentes en navegador, n8n y MCP

Agentes que navegan por la web

Están expuestos continuamente a contenido externo. Usa un perfil de navegador separado, evita sesiones administrativas, restringe descargas y dominios, y exige aprobación antes de publicar, comprar, enviar o cambiar configuraciones. Una pestaña no confiable no debe poder acceder a secretos de otra aplicación.

Automatizaciones con n8n

Separa credenciales por flujo y entorno, limita el alcance de cada conexión, valida los datos antes de nodos con efectos y conserva ejecuciones suficientes para investigar incidentes. Consulta el tutorial de n8n en español para entender el flujo y aplica estos controles antes de producción.

Servidores MCP

Un servidor MCP amplía las capacidades disponibles para el modelo. Trátalo como una integración con privilegios: verifica su origen, revisa las herramientas expuestas, fija versiones, separa entornos y monitoriza cambios. Nuestra guía de MCP explica sus componentes.

Qué no debes asumir

  • «El modelo bloquea contenido peligroso»: las salvaguardas son una capa, no un control de autorización.
  • «Solo accede a lo que yo puedo ver»: heredar todos los permisos de una persona suele ser excesivo.
  • «Hay una aprobación humana»: no sirve si la persona no recibe contexto, no tiene tiempo o aprueba de forma automática.
  • «Tenemos logs»: deben ser íntegros, consultables y útiles para reconstruir acciones, sin almacenar secretos.
  • «Cumplir el AI Act cubre la ciberseguridad»: el Reglamento se suma a protección de datos, seguridad, contratos y reglas sectoriales.

Relación con el AI Act y la responsabilidad legal

No existe una regla por la que «quien despliega siempre responde». El papel, el uso, el contrato y la causa del daño importan. El AI Act exige medidas concretas solo en determinados supuestos y no sustituye la responsabilidad civil ni la normativa de ciberseguridad.

Consulta la guía actualizada del AI Act para agentes de IA y nuestro análisis de responsabilidad legal por agentes de IA.

Checklist de seguridad de agentes de IA antes de activarlos

  1. Identidad separada y credenciales revocables.
  2. Permisos documentados y revisados.
  3. Acciones sensibles con aprobación contextual.
  4. Contenido externo tratado como no confiable.
  5. Validación de parámetros en el backend.
  6. Límites de uso, coste y velocidad.
  7. Registros sin secretos y con retención definida.
  8. Pruebas de abuso y fallo completadas.
  9. Alertas y responsable de incidentes asignado.
  10. Parada y revocación ensayadas.

Preguntas frecuentes

¿Un modelo más avanzado elimina la inyección de prompts?

No. Puede reducir determinados ataques, pero no sustituye el aislamiento, la autorización y la validación. Diseña el sistema suponiendo que alguna instrucción maliciosa atravesará las defensas del modelo.

¿Debo guardar todo lo que el agente piensa?

No. Para auditoría importan las entradas relevantes, las herramientas, parámetros, aprobaciones, resultados y cambios. Conserva solo lo necesario y evita secretos o datos personales excesivos.

¿Puedo empezar sin un equipo de seguridad?

Sí, con un caso de bajo impacto, datos de prueba, permisos mínimos y aprobación manual. No empieces por pagos, producción, datos sensibles o decisiones sobre personas sin apoyo especializado.

Fuentes oficiales y técnicas

Las medidas deben adaptarse al riesgo, los activos, la arquitectura y la normativa aplicable. Para sistemas con datos sensibles, capacidad de ejecutar código, transferir dinero o afectar a personas, solicita una revisión profesional independiente.

author avatar
Daniel Bellido
Consultor de inteligencia artificial especializado en agentes autónomos y automatización empresarial. Ayudo a pymes y empresas españolas a implementar soluciones de IA agentica con herramientas como n8n, Make, LangChain y AutoGPT. Analizo plataformas, flujos de trabajo y casos de uso reales para que cualquier empresa pueda dar el salto a la IA en 2026.