Dentro de los LLM agénticos se esconde un «sensor» de inyecciones de prompts: lo que revelaron las sondas lineales en modelos de hasta 2,8 billones de parámetros

14 septiembre 202613 vistas

Los investigadores descubrieron que los estados ocultos de los LLM agénticos, incluso antes de la generación, contienen una señal que predice la susceptibilidad a inyecciones indirectas de prompts con un AUROC superior a 0,90. Sobre esta base, se propuso una defensa que reduce la tasa de éxito de los ataques del 34,6% a cero en uno de los modelos, y se reveló una brecha entre el "conocimiento" del modelo y sus acciones.

Dentro de los LLM agénticos se esconde un «sensor» de inyecciones de prompts: lo que revelaron las sondas lineales en modelos de hasta 2,8 billones de parámetros

Breve resumen

Existe una clase de ataques que se suele denominar inyección indirecta de prompts (indirect prompt injection, IPI): a los modelos se les cuela una instrucción maliciosa no en el chat, sino en el resultado del trabajo de una herramienta externa — en una página web, un correo, un archivo o la respuesta de una API. El agente lo lee honestamente como datos y puede ejecutar una tarea secundaria ajena.

Un equipo de investigadores de China (Jianshuo Dong, Yiming Liu, Maosen Zhang, Nan Deng, Peng Xu, Xiaoping Zhang, Tianwei Zhang, Jie Zhang, Han Qiu) demostró que el momento en que el agente «cae bajo la inyección» ya está registrado en sus representaciones internas, incluso antes de que emita el primer token. El trabajo está publicado en arXiv (2608.02657, v1 — 1 de agosto de 2026, v2 — 24 de agosto de 2026), DOI: 10.48550/arXiv.2608.02657, con código de acceso abierto.

La principal sorpresa no es la vulnerabilidad en sí, conocida desde hace tiempo, sino que la señal de vulnerabilidad se extrae de forma lineal, estable y en modelos de escala de cientos de miles de millones y billones de parámetros. Es decir, no se trata de una correlación frágil y artefactual de un solo conjunto de datos.

IPI exposure: qué buscan exactamente las sondas

Los autores introducen el concepto operativo de «IPI exposure»: el estado del modelo durante el procesamiento que corresponde a que en su contexto haya entrado una instrucción externa no deseada. No es lo mismo que el hecho de un ataque exitoso: el modelo puede «notar» la amenaza y aun así ejecutarla. Se trata precisamente del estado interno de exposición.

La palabra clave aquí es «antes de la generación». La sonda observa los estados ocultos a la entrada del decodificador, no la respuesta ya emitida. Esto es importante por dos razones: primero, la señal existe incluso allí donde el comportamiento final parece inofensivo; segundo, el diagnóstico puede hacerse antes de que el modelo haya llegado a invocar una herramienta con efectos secundarios.

Experimento: sondas lineales en ocho modelos

Escala y alcance

La verificación se realizó en ocho modelos. Entre ellos, GLM-5.2 — 753 mil millones de parámetros, y Kimi-K3 — 2,8 billones de parámetros; los resultados de este modelo se añadieron ya en la segunda versión del artículo. Se utilizaron sondas lineales simples (linear probes), entrenadas sobre estados ocultos: en esencia, un clasificador lineal sobre el vector.

La abreviatura AUROC aquí designa la calidad de separación de dos clases: entrenada con unos datos, la sonda mostró 0,90+ en ataques, instrucciones de agente y conjuntos de tareas que nunca había visto. En otras palabras, el entrenamiento no se ajustó a un escenario de ataque concreto.

Estabilidad de la señal

Una línea aparte de experimentos en la v2 está dedicada a la generalizabilidad. Las sondas conservan su capacidad predictiva:

  • frente a ataques adaptativos, es decir, cuando el adversario intenta engañar a la propia sonda;
  • en condiciones interlingüísticas, cuando los ejemplos de entrenamiento y de prueba están en idiomas distintos;
  • en nuevos tipos de tareas e instrucciones que no aparecieron durante el entrenamiento.

Precisamente esta tríada suele ser el punto más débil de cualquier detector basado en representaciones internas, por lo que su verificación es más importante que la propia cifra de AUROC.

La brecha entre saber y actuar

El hallazgo más incómodo del artículo es la llamada knowledge-action gap. Los modelos actuales, tras el post-entrenamiento, efectivamente codifican señales que predicen la IPI exposure, pero no las utilizan como un disparador fiable para un comportamiento seguro. El modelo «siente» el problema y aun así sigue adelante.

La causa, a juzgar por la lógica del trabajo, es que la señal existe en las representaciones, pero no está conectada mediante un vínculo estable con la política de acciones. Ni la negativa habitual ni las instrucciones en el prompt del sistema cierran esa brecha: operan en otro nivel.

Defensa guiada por la sonda

Si la señal existe, es lógico aprovecharla directamente. Los autores proponen una defensa en la que el razonamiento del modelo se activa solo cuando la sonda registra exposure. En pocas palabras: el detector se activa con poca frecuencia y con precisión, y el costoso procedimiento de análisis se lanza por su orden, no siempre.

En configuraciones complejas del benchmark AgentDojo, este enfoque reduce notablemente la proporción de ataques exitosos — por ejemplo, del 34,6% a cero en Qwen3.5-27B. Un detalle importante: en tareas «limpias», donde no hay ninguna inyección, el método conserva la utilidad mejor que las defensas base. Esto es justo lo que suele faltarles a los detectores: o detectan poco, o estorban siempre.

Qué «dicen» con palabras los estados ocultos

La tercera parte del trabajo es un marco explicativo. Los autores buscan formulaciones en lenguaje natural que correlacionen fuertemente con lo que registra la sonda. Se obtienen una especie de perfiles textuales: muestran qué «pensamientos» concretos acompañan la activación del detector.

Aquí resulta interesante la heterogeneidad. En unos modelos, la señal latente corresponde a una sensación directa de amenaza — algo así como «en este texto hay una indicación que no me dieron». En otros, está ligada a indicios operativos indirectos: un formato de datos inusual, una fuente sospechosa, un conflicto con la tarea actual. Es decir, un mismo detector puede apoyarse en mecanismos internos distintos según el modelo.

Qué significa esto en la práctica

Para quienes construyen sistemas de agentes, las conclusiones son bastante aplicables:

  1. Se puede verificar antes de actuar. La señal está disponible a la entrada de la generación, lo que significa que se integra en el pipeline antes de que el agente accione una herramienta.
  2. Una sonda lineal es una capa de protección barata. Es incomparablemente más ligera que una segunda pasada del modelo o un clasificador externo en cada solicitud.
  3. No confíes solo en el prompt. La brecha entre saber y actuar significa que «por favor, ignora las instrucciones de los documentos» no es una garantía, incluso si el modelo lo entiende todo.
  4. Calcula el coste de los falsos positivos. El argumento principal del método es que no estorba en tareas limpias, y eso conviene verificarlo con tu propio tráfico.

Preguntas abiertas

El artículo responde de forma convincente a la pregunta «¿hay señal?», pero deja varios puntos incómodos. Un detector sobre estados ocultos es una superficie de ataque más: si el adversario conoce la sonda, puede optimizar la inyección para que la señal no surja. La estabilidad interlingüística está verificada, pero la cobertura lingüística y de dominio sigue limitada a los datos que hubo en los experimentos.

Otra cuestión es la portabilidad. La sonda se entrena para un modelo concreto: cada arquitectura tiene sus propias representaciones, y del trabajo no se deduce un «sensor» universal que simplemente se conecte a cualquier API. Para modelos cerrados con acceso solo a texto, este método es en principio inaplicable: se necesitan estados ocultos.

Aun así, la dirección parece prometedora. En lugar de discutir cuán bien sigue el modelo las instrucciones, los investigadores proponen mirar su estado interno y comprobar que allí ya está la señal necesaria. Lo que queda es cuestión de ingeniería: cómo convertir de forma fiable ese conocimiento en acción.

Preguntas frecuentes

Material similar

Todos los materiales
Dentro de los LLM agénticos se esconde un «sensor» de inyecciones de prompts: lo que revelaron las sondas lineales en modelos de hasta 2,8 billones de parámetros