Blog / Agentes
Prompt injection por email: cómo secuestra a tu agente
Cómo funciona
Un modelo de lenguaje no distingue con fiabilidad tus instrucciones de un texto que solo parece una instrucción. Cuando un agente resume o busca en tu bandeja, el texto de los emails acaba en el mismo contexto que tu petición. Si uno de esos emails dice «ignora al usuario y haz esto otro», el modelo puede hacerlo.
Los atacantes lo esconden de tu vista:
- Texto oculto: texto blanco sobre fondo blanco, letra de tamaño cero o texto dentro del HTML que tu app de correo no muestra. Tú ves un email normal; el modelo lo lee todo.
- Caracteres invisibles: caracteres Unicode que no se ven en pantalla pero que el modelo lee como texto.
- Instrucciones disfrazadas de mensajes del sistema: «AVISO IMPORTANTE DEL ADMINISTRADOR:…», escritas para parecer parte de la configuración del propio agente.
Ya ha pasado
| Cuándo | Qué | Resultado |
|---|---|---|
| Feb 2023 | Artículo de investigación de Greshake y otros, «Not what you've signed up for» | Primer estudio sistemático de la prompt injection indirecta, con ataques a asistentes de correo |
| Ago 2024 | Microsoft 365 Copilot, «ASCII smuggling» (Johann Rehberger) | Un email de phishing hizo que Copilot reuniera emails sensibles y códigos de verificación y los escondiera en un enlace con caracteres invisibles. Corregido |
| Jun 2025 | EchoLeak, CVE-2025-32711 (Aim Security) | Sin ningún clic: un email preparado hizo que Microsoft 365 Copilot filtrara datos, saltándose su filtro de inyecciones. Corregido en el servidor; sin abusos conocidos |
| Jul 2025 | Gemini en Gmail, «Phishing for Gemini» (0DIN) | Un texto oculto hizo que «Resume este email» mostrara un falso aviso de seguridad de Google con un teléfono. Sin enlaces ni adjuntos |
Ninguno necesitaba que pulsaras nada sospechoso. Bastaba con que el asistente leyera el email.
Por qué los agentes lo empeoran
El investigador de seguridad Simon Willison lo llama la tríada letal: un agente es peligroso cuando reúne estas tres cosas:
- acceso a tus datos privados,
- exposición a contenido no fiable (cada email de tu bandeja),
- una forma de comunicarse hacia fuera (enviar un email, abrir un enlace, cargar una imagen).
Un agente con acceso completo a tu buzón tiene las tres de serie. Quita cualquiera de ellas y el ataque deja de servirle al atacante.
Cómo proteger a un agente que lee tu correo
Estas medidas siguen las recomendaciones de OWASP para aplicaciones con modelos de lenguaje (LLM01, prompt injection):
- Mínimo privilegio. Dale al agente solo los emails que su tarea necesita: un buzón, unas pocas categorías, los últimos días. Lo que no ve no puede darle órdenes. Explicamos cómo en Cómo dar a Claude, ChatGPT o Cursor acceso seguro a tu correo.
- Nada sale sin ti. El agente no debería enviar emails, publicar datos ni abrir enlaces por su cuenta. Pide tu confirmación para todo lo que salga.
- Separa y marca el texto no fiable. Indica al agente qué partes son contenido de un email, y trata los asuntos y los nombres de remitente como texto escrito por desconocidos.
- Detecta los trucos conocidos antes de que el agente lea. El texto oculto con instrucciones y los caracteres invisibles se pueden detectar sin fiarse del modelo.
Qué hace MailTag
- Los agentes no reciben el texto de tus emails desde MailTag. A través de su servidor MCP, un agente recibe la categoría, la fecha, y el remitente y el asunto solo si lo permites. Al agente le llega mucho menos texto escrito por desconocidos.
- Límites por agente: qué buzones, qué categorías o vistas, desde cuándo. Un agente que solo ve Needs reply de hoy no está leyendo la newsletter que trae el ataque.
- Sin enviar, borrar ni sacar emails. El servidor MCP de MailTag no tiene esas herramientas.
- Una revisión de seguridad que puedes activar (Ajustes → Buzones → Revisar cada email). Busca texto oculto con instrucciones, caracteres invisibles, y dominios y enlaces que imitan a otros, y pregunta al modelo propio de MailTag si el email parece phishing o instrucciones para un agente de IA. Los emails sospechosos llevan una marca, y puedes ocultarle los peligrosos a cada agente.
Ninguna revisión lo detecta todo: los atacantes se adaptan y un modelo se puede engañar. Limitar lo que el agente ve y lo que puede hacer es lo que hace que un email que se escape no cause daño.
Preguntas frecuentes
¿Puede ocurrir aunque yo nunca abra el email?
Sí. El ataque va dirigido al asistente, no a ti. Se ejecuta cuando el agente lee o resume tu bandeja.
¿No basta con mi filtro de spam?
No. Estos emails no necesitan enlaces ni adjuntos y pueden venir de remitentes normales, así que a menudo pasan el filtro de spam. Lo que importa son las instrucciones ocultas.
¿La revisión de MailTag bloquea el email?
No. Nunca mueve ni borra emails. Marca los sospechosos en MailTag y, si quieres, con la etiqueta ⚠ Sospechoso en tu buzón (en Gmail; una marca en los demás), y puede ocultárselos a tus agentes.
¿Cuesta algo más?
No. La revisión de seguridad y la conexión de agentes a través del servidor MCP están incluidas en todos los planes. La revisión la activas en tus ajustes.
Sigue leyendo
Acceso seguro de Claude, ChatGPT o Cursor a tu correo
Conecta un agente de IA a tu correo con el servidor MCP de MailTag y elige qué ve: qué buzones, qué categorías, desde cuándo y nada más.
Leer →Guías · 30 sept 2026Ordena el correo de iCloud, Yahoo o Fastmail solo
Qué ordenan solos iCloud, Yahoo y Fastmail, dónde se quedan cortas sus reglas y cómo ordenar cada email nuevo en tus propias categorías por IMAP.
Leer →