DiSCO: protección de text-to-image contra contenido dañino sin acceso al interior del modelo

26 agosto 202611 vistas

El nuevo método DiSCO funciona como un módulo externo: selecciona prompts seguros y reduce la tasa de ataques red-team exitosos en un 37,7% para modelos desprotegidos y en un 25,13% para sistemas ya protegidos. Además, la precisión semántica se mantiene y la coherencia de las imágenes incluso mejora.

DiSCO: protección de text-to-image contra contenido dañino sin acceso al interior del modelo

Amenaza oculta en prompts inofensivos

Las redes neuronales modernas que generan imágenes a partir de descripciones de texto pueden crear imágenes impresionantes, pero a veces «producen» contenido no deseado. Normalmente, la protección de estos sistemas se basa en intervenir en su funcionamiento interno: reentrenar el codificador de texto, ajustar los pesos o aplicar un procesamiento especial en la fase de inferencia. Este enfoque es eficaz mientras se tenga acceso al propio modelo, pero no sirve en absoluto para servicios propietarios cerrados que funcionan como una «caja negra».

Como alternativa, se intenta utilizar grandes modelos de lenguaje para reescribir automáticamente las solicitudes en una forma segura. Pero aquí también hay un punto débil: el prompt resulta lingüísticamente totalmente inofensivo, sin embargo, debido a cómo el modelo distribuyó los datos durante el entrenamiento, la generación sigue derivando hacia un área dañina. Los autores denominan a este modo «benign adversarial» — cuando el texto es formalmente seguro, pero el resultado no lo es.

Qué propone DiSCO

El método DiSCO (Distribution-guided contrastive prompt optimization), desarrollado por un grupo de investigadores, propone un enfoque completamente diferente: proteger la generación a nivel de prompts sin mirar dentro del modelo. Es una solución estrictamente de caja negra que funciona como un módulo externo plug-and-play. No requiere ajuste fino, reentrenamiento ni información alguna sobre los parámetros o la arquitectura del sistema objetivo.

La idea es modificar automáticamente el sufijo — es decir, la parte final del prompt — de manera que la generación se dirija hacia un cauce seguro. La búsqueda del sufijo adecuado se realiza mediante beam search, y la calidad de los candidatos se evalúa con un scoring contrastivo. Para ello, el módulo genera previamente, utilizando el propio modelo objetivo, dos conjuntos de imágenes: seguras e inseguras. Al comparar los resultados de la generación con los conjuntos de referencia, DiSCO comprende en qué dirección debe «empujar» el sufijo.

El proceso es iterativo: tras cada paso, el módulo evalúa la imagen obtenida y, si aún contiene elementos no deseados, ajusta el sufijo de nuevo. Esto continúa hasta que la generación se ajusta al conjunto seguro. En ningún momento se requiere revelar el interior del modelo — toda la interacción se realiza únicamente enviando prompts y recibiendo imágenes.

Qué tan eficaz es

Los investigadores probaron DiSCO en el benchmark I2P (Inappropriate Image Prompts) en escenarios de múltiples ataques de red-teaming. El resultado muestra que la tasa de ataques exitosos se reduce en un 37,7% para modelos sin ninguna protección y en un 25,13% para modelos que ya estaban protegidos con otros métodos. Esto significa que DiSCO no solo cubre las brechas donde no hay protección, sino que también refuerza las barreras existentes.

Es revelador que la precisión semántica no se vea afectada: las imágenes generadas siguen siendo relevantes al prompt original, e incluso la coherencia mejora. En otras palabras, el módulo no perjudica la calidad de la generación, sino que simplemente la aleja de interpretaciones potencialmente peligrosas.

Dado que DiSCO es agnóstico a la arquitectura, se puede conectar a cualquier sistema text-to-image sin modificar el modelo en sí. Esto es especialmente valioso para APIs comerciales cerradas donde el acceso es limitado, y para usuarios que quieren aumentar la seguridad de servicios de terceros — por ejemplo, antes de usarlos en aplicaciones públicas.

A pesar de los impresionantes resultados, conviene recordar que el método no es una «bala de plata», sino una de las capas de protección. Eliminar por completo los riesgos probablemente no sea posible, pero desplazar el enfoque de la seguridad «interna» a la «externa» y adaptativa es un paso importante hacia la resiliencia de los sistemas generativos frente a solicitudes maliciosas.

Preguntas frecuentes

DiSCO: protección de text-to-image contra contenido dañino sin acceso al interior del modelo