Denominado Agentjacking, puede activarse mediante un informe de error falso creado con Sentry
Investigadores de ciberseguridad han descrito lo que, según afirman, es una nueva clase de ataque capaz de engañar a los agentes de codificación de inteligencia artificial (IA) para que ejecuten código arbitrario en las máquinas de los desarrolladores.
Este ataque, denominado Agentjacking por Tenet Security, puede activarse mediante un informe de error falso creado con Sentry, una plataforma de código abierto para el seguimiento de errores y la monitorización del rendimiento.
"El ataque explota una falla arquitectónica crítica en la intersección de la ingesta de eventos de Sentry (que acepta cargas útiles arbitrarias de cualquier persona con el DSN) y el servidor Sentry MCP (que devuelve estos datos a los agentes de IA como salida confiable del sistema)", dijeron los investigadores de seguridad Ron Bobrov, Barak Sternberg y Nevo Poran.
La idea consiste en inyectar datos manipulados en los eventos de error de Sentry, que luego son interpretados por agentes de codificación como Claude Code y Cursor como pasos legítimos de resolución de diagnóstico y ejecutan código controlado por el atacante.
Un ataque exitoso de este tipo puede exponer datos confidenciales, incluidas variables de entorno, credenciales de Git, URL de repositorios privados e identidades de desarrolladores, sin tener que recurrir a métodos como el phishing o el compromiso previo del servidor.
El problema radica en la confianza implícita asociada a la conexión con servicios externos mediante el Protocolo de Contexto de Modelo (MCP). Dado que un agente de IA no puede distinguir entre un evento de error generado por un fallo real de la aplicación o inyectado por un atacante, se crea una vía para la ejecución de código arbitrario cuando el agente procesa la respuesta.
La cadena de ataque ideada por Tenet es la siguiente:
• Un atacante encuentra el nombre de la fuente de datos de Sentry (DSN) de un objetivo, una credencial pública de solo escritura que está integrada en los sitios web.
• El atacante envía un evento de error malicioso al punto final de ingesta de Sentry mediante una solicitud POST utilizando el DSN.
• El evento inyectado contiene "markdown cuidadosamente formateado" en el campo de mensaje y en los nombres de las claves de contexto. Cuando el servidor Sentry MCP devuelve este evento a un agente de IA, se muestra como contenido estructurado visualmente idéntico a la plantilla del sistema Sentry.
• Cuando un desarrollador le pide a su agente de codificación de IA que "corrija los problemas no resueltos de Sentry" (o una solicitud similar), el agente consulta a Sentry a través de MCP y recibe el evento malicioso.
• El agente ejecuta código malicioso, que se ejecuta con todos los privilegios del desarrollador.
"El atacante nunca toca la infraestructura de la víctima", explicaron los investigadores. "La instrucción maliciosa llega disfrazada de una "solución" legítima dentro de un error común. Cuando un desarrollador le pide a su agente de IA que solucione el problema de Sentry, el agente interpreta el comando del atacante como una guía confiable y lo ejecuta, con los privilegios del desarrollador y en su propia máquina".
El secuestro de agentes se distingue porque ataca al agente de IA en el que confía el desarrollador y utiliza un DSN de Sentry como punto de partida. Además, la inyección de Markdown se presenta de tal manera que el agente no puede distinguirla de las instrucciones legítimas de Sentry.
La empresa de ciberseguridad de IA afirmó haber encontrado al menos 2.388 organizaciones expuestas con DSN inyectables válidos, y que probó el ataque de forma controlada contra más de 100 organizaciones, logrando una tasa de éxito de explotación del 85% contra errores inyectados en algunos de los asistentes de codificación de IA más utilizados.
Por su parte, Sentry reconoció el problema, pero optó por no solucionarlo, alegando que "técnicamente no tiene justificación". Sin embargo, se dice que la compañía activó un filtro de contenido global que bloquea una "cadena de datos específica".
"Mientras las empresas se apresuran a implementar agentes de codificación de IA, esta investigación demuestra que los propios agentes se han convertido en la superficie de ataque, volviéndose contra los desarrolladores que confían en ellos, utilizando únicamente los datos que esas organizaciones publican sobre sí mismas", afirmó Tenet. "El ataque elude EDR, WAF, IAM, VPN, Cloudflare y firewalls, porque no hay nada malicioso que detectar. Cada acción en la cadena está autorizada".








