Clicky

Esta dirección de correo electrónico está siendo protegida contra los robots de spam. Necesita tener JavaScript habilitado para poder verlo.

Falsa habilidad de agente de IA superó los controles de seguridad y llegó a tener 26.000 agentes

falso agente de IA

Los mercados públicos de habilidades están siendo inundados de habilidades maliciosas

La empresa de seguridad AIR creó una falsa habilidad (skills en inglés) de agente de IA, la promocionó a través de un popular mercado de habilidades y un anuncio en Instagram, y afirma haber llegado a aproximadamente 26.000 agentes, incluidos algunos en cuentas corporativas.

Todos los escáneres de seguridad de Skill que la empresa utilizó para probarlo lo consideraron seguro. La carga útil era inofensiva por diseño: recopilaba la dirección de correo electrónico del usuario y no hacía nada más.

El objetivo era demostrar que ninguna de las señales en las que la gente se apoya para confiar en una habilidad la detectaba: ni los escáneres, ni las estrellas de GitHub, ni la reputación del código abierto.

Una habilidad es un conjunto de instrucciones que un agente carga en su propio contexto y sigue con una autoridad similar a la de una solicitud del usuario. Esa confianza es el problema principal, y es la razón de ser de las herramientas de análisis de habilidades.

La habilidad, denominada brand-landingpage , afirmaba crear una página de destino utilizando la herramienta de diseño Stitch de Google, dirigida directamente a usuarios no técnicos.

Para darle credibilidad, AIR buscó dos señales de confianza: estrellas de GitHub y un veredicto de escaneo limpio. Para obtener las estrellas, abrió una solicitud de extracción a un repositorio de mercado de habilidades con aproximadamente 36.000 estrellas y 156 habilidades.

La solicitud de extracción se fusionó después de unos días, por lo que la habilidad heredó el número de instancias del repositorio. Luego, se lanzó un anuncio en Instagram dirigido a profesionales del marketing, vendedores y diseñadores, quienes la instalaron y la pusieron en funcionamiento.

skills de agente de IA

Por qué no lo detectaron los escáneres

Los escáneres que AIR probó analizan el paquete que se les entrega: el archivo SKILL.md y los archivos que lo acompañan. Esto incluye los archivos de Cisco, NVIDIA y los que están integrados en skills.sh.

La habilidad de AIR no incluía instrucciones de configuración propias. Indicaba al agente de IA que instalara el "Stitch SDK" siguiendo la documentación disponible en un enlace externo, stitch-design.ai, un dominio que controla AIR, no Google (el Stitch original se encuentra en stitch.withgoogle.com).

Al principio, el enlace conducía a la documentación original de Stitch, por lo que los escáneres, al ver un paquete limpio que apuntaba a una página de configuración plausible, lo borraron. La página que el agente debía descargar y seguir quedaba fuera del alcance del escaneo.

Una vez que la función se instaló de forma generalizada, AIR cambió la página que aparecía detrás de ese enlace. La nueva versión le indicaba al agente que descargara y ejecutara un script.

En la demostración, solo se enviaba la dirección del usuario a AIR, que era como la empresa contabilizaba los agentes a los que llegaba. Un operador real podría haber utilizado ese punto de acceso para leer archivos, transferir datos o acceder a sistemas internos, limitado únicamente por el alcance del agente.

AIR no es el primero en demostrar esto. Tres semanas antes, Trail of Bits eludió el detector de habilidades maliciosas de ClawHub, el escáner de Cisco y los tres escáneres conectados a skills.sh. Su conclusión fue contundente: un escáner verifica un paquete fijo, mientras que un atacante puede seguir modificando la carga útil hasta que pase la prueba.

Las campañas reales han utilizado el mismo truco durante meses, manteniendo la habilidad enviada limpia y alojando la carga útil en un sitio que el agente solo descarga durante la instalación.

El problema es estructural: el escaneo se realiza una sola vez, pero la página a la que apunta la habilidad puede modificarse posteriormente. La propia documentación de Anthropic ya advierte que las habilidades que acceden a URL externas son riesgosas precisamente por este motivo, ya que el contenido puede cambiar después de que la habilidad haya sido verificada.

Una investigación independiente realizada este año reveló que los evaluadores a menudo discrepan, porque cada uno juzga una habilidad de forma aislada, sin tener en cuenta sus vínculos externos ni los cambios que se producen tras la revisión.

¿Qué hacer?

La conclusión para los defensores es la misma a la que llegan los investigadores, ahora con un ejemplo más claro. Traten las habilidades como software, no como texto. Analicen a qué apunta una habilidad, no solo qué contiene.

La mayoría de estos plugins se instalaron sin revisión, así que lo primero es averiguar qué ya está en funcionamiento. Dirige las nuevas habilidades a través de una única fuente que controles y revísalas cada vez que haya algún cambio, porque un resultado limpio en la instalación no se mantendrá si la habilidad se conecta a un enlace que otra persona puede editar.

Versiones fijas. Mantener a los agentes con el mínimo privilegio. Asumir que cualquier instrucción externa que un agente obtenga se ejecuta con el acceso del agente.

Las cifras que se mencionan provienen únicamente de AIR y merecen una lectura escéptica. La empresa está lanzando un mercado de habilidades gestionadas y, al final del artículo, lo promociona, por lo que la cifra de 26 000, los detalles de la cuenta corporativa y la afirmación de que podría haber tomado el control total de cada agente son datos propios de la empresa y no han sido confirmados de forma independiente.

Lo que se mantiene es el método. Los escáneres mencionados realmente solo evalúan el paquete enviado, el punto ciego de los enlaces externos es real y se ha demostrado de forma independiente, y las señales de confianza que AIR toma prestadas, las estrellas y un escaneo limpio son precisamente las que el ecosistema sigue tratando como prueba.

El experimento no expone un nuevo fallo, sino que reúne todas las señales de confianza débiles relacionadas con las habilidades de los agentes en una sola ejecución: estrellas que se pueden tomar prestadas, un escaneo que lee una instantánea y un enlace que se puede reescribir después de que se complete la verificación.

Ya sea que la cifra real sea de 26.000 o una fracción de ella, la brecha que atraviesa es una que los defensores aún no han logrado cerrar.

Jesus_Caceres