
Diseño de prompts corporativos seguros, verificables y auditables.

Prompt injection directo, indirecto y persistente.

Instrucciones maliciosas embebidas en documentos, webs, emails, tickets y fuentes externas.

Validación y sanitización de inputs y outputs.

Separación entre hechos, inferencias, hipótesis y recomendaciones.

Seguridad de system prompts e instrucciones privilegiadas.

Concepto de agente: modelo, instrucciones, herramientas, memoria, contexto, identidad y capacidad de acción.

Agent goal hijacking y manipulación de objetivos.

Tool misuse & exploitation.

Identity & privilege abuse y gestión de identidades no humanas.

Unexpected code execution.

Memory & context poisoning.

Insecure inter-agent communication.

Cascading failures.

Human-agent trust exploitation y automatización complaciente.

Rogue agents y comportamiento fuera de política.

MCP como capa de conexión entre agentes, herramientas, APIs y fuentes de datos.

Seguridad de servidores MCP, clientes MCP y herramientas de terceros.

Autenticación, autorización, permisos delegados, validación y aislamiento de sesiones en MCP.

Supply chain de herramientas, plugins, servidores MCP y componentes agentic.

Mínimo privilegio, permisos just-in-time y segmentación de capacidades.

Human-in-the-loop y human-on-the-loop según criticidad.

Confirmaciones antes de acciones irreversibles.

Límites de consulta, propuesta, ejecución y escalado.

Kill switches, revocación y aislamiento de agentes.

Inventario, identidad, propietarios y ciclo de vida de agentes.

Logging, trazabilidad y observabilidad de acciones y decisiones.

Monitorización y enforcement de políticas en runtime.

Agent Control Standard y controles portables para sistemas agentic.

Pruebas adversariales y red teaming antes y después del despliegue.