Un ataque innovador usa imágenes aparentemente inofensivas Infiltrarse en instrucciones ocultas en sistemas de inteligencia artificial. El truco consiste en insidiar indicaciones malignas dentro de imágenes de alta resolución Que, una vez reducido de tamaño, revela contenido visible solo para la máquina. El método, desarrollado por los investigadores de Trail of Bits, es una evolución concreta de los estudios sobre la vulnerabilidad del algoritmo de reducción. El peligro es real: el modelo AI interpreta esos mensajes invisibles como parte del APUT y puede activar acciones no deseadas sin que el usuario lo note.
Cómo funciona el ataque
El corazón de la técnica consiste en la preparación de Imágenes con patrones específicosimperceptible al ojo humano, que emerge solo cuando la imagen está sujeta a una reducción automática. En entornos, para optimizar los servicios o reducir los costos, las imágenes a menudo se descargan a través de la interpolación, procedimientos que pueden generar artefactos. Los expertos crearon imágenes en las que las áreas oscuras se vuelven rojas y, durante la escalado de Bicubica, sacan texto negro oculto.
Illinois Modelo ai Lee ese texto como indicación del usuario y lo combina con una entrada legítima, sin que el usuario lo note. Un caso concreto se refiere a Gemini CLI: Uso de Zapier MCP con la configuración «Trust = True», el sistema extrajo datos del calendario del usuario y los envió a un correo electrónico arbitrario, sin notificar la acción al usuario de ninguna manera.
Géminis en las vistas
Los autores explican que el ataque debe calibrarse en base a caso de caso, dependiendo del algoritmo de reducción utilizado por el sistema AI. Sin embargo, lograron demostrar el Vulnerabilidad de Google Géminis CLIVertex a Studio (con Backand Gemini), la interfaz web de Gemini, las abejas Gemini a través de LLM CLI, Google Assistant en Android y Genspark. El hecho de que las interfaces tan diferentes sean vulnerables sugiere que el perímetro del ataque corre el riesgo de extenderse mucho más allá de los casos probados.
Para facilitar la experimentación, publicaron los investigadores Anamorfouna herramienta de código abierto en beta que genera imágenes adecuadas para cada método de reducción de escala. A medida que mide el contraste, Trail of Bits ofrece límites rígidos en el tamaño de las imágenes en carga, la visualización de una vista previa del resultado que el modelo probará y la obligación de confirmar explícitamente las operaciones sensibles, especialmente cuando se detecta el texto. Sin embargo, el remedio más efectivo sigue siendo un diseño seguro y defensas sistemáticas contra inyecciones rápidas, inspirados en modelos para sistemas LLM resistentes a estos ataques.