Verificación de dos señales en checkpoints: detectando la ablación oculta y sus puntos débiles

8 septiembre 202624 vistas

El autor propone una auditoría sin umbrales de modelos abiertos de pesos mediante un par de señales complementarias dentro del artefacto. En pruebas con 273 checkpoints, el método alcanza un AUROC de 0.95, pero sigue siendo un triaje, no una protección contra la evasión deliberada.

Verificación de dos señales en checkpoints: detectando la ablación oculta y sus puntos débiles

Por qué verificar los checkpoints, y no solo sus respuestas

Al preparar un modelo abierto para su despliegue, es importante entender quién lo modificó y cómo. Además del fine-tuning habitual, existe la abliteración — una técnica que elimina selectivamente de las activaciones la señal de rechazo ante solicitudes dañinas. El modelo permanece externamente similar al original, pero en la práctica funciona sin el «freno» interno. Detectar esta intervención mediante las generaciones es difícil: los guardas de runtime ejecutan prompts de prueba y evalúan las respuestas, no el artefacto en sí. Si el escenario dañino no está en el conjunto de prueba, nadie notará la modificación. Por eso, una auditoría honesta de los pesos debe realizarse antes de la inferencia, no durante ella.

Dos ejes de verificación: la brecha de activación y la huella en los pesos

La investigación, presentada en el área de criptografía y seguridad, describe una auditoría de dos señales de bajo costo que no requiere ajuste de umbrales ni se basa en pruebas conductuales externas. El checkpoint sospechoso se compara con una referencia atestiguada (attested reference) a lo largo de dos ejes:

  • Reference-anchored activation refusal-gap — la brecha entre las activaciones relacionadas con el rechazo, entre el candidato y la referencia. Si la abliteración ha borrado el patrón de rechazo, la brega se comporta de manera diferente a la de un fine-tuning honesto.
  • Weight-recovery energy — la energía de recuperación de pesos: cuán fuerte debe ser el cambio de parámetros para devolver al candidato a la versión base. Esta señal detecta incluso aquellas intervenciones que apenas se reflejan en las activaciones.

Las señales están correlacionadas negativamente, por lo que su estadística z combinada resulta más informativa que cada eje por separado. El primer eje aporta especificidad: muestra si el mecanismo de rechazo está realmente afectado. El segundo aporta exhaustividad: no permite ocultar la modificación en cambios poco perceptibles de los pesos.

¿Qué tan fiable es el método en la práctica?

La auditoría se probó en un registro de 273 checkpoints que abarca diferentes arquitecturas abiertas. Dentro de la muestra, la señal z combinada separaba casi sin errores 57 abliteraciones públicas de 37 casos habituales de fine-tuning, fusiones y ajustes por instrucciones: AUROC 0.95. Por separado, las mismas señales dan resultados notablemente peores: 0.84 y 0.90. Más interesante aún, el umbral calibrado según el criterio de Youden se transfiere a nuevas familias no vistas anteriormente. Allí, la precisión balanceada (balanced accuracy) fue de 0.89 con una tasa de falsos positivos de 0.11. De las 57 abliteraciones, el método solo omitió 4 — para los estándares de un filtro primario, es un buen resultado.

Puntos débiles: cuando ambos ejes se ven comprometidos

Ninguna auditoría basada en dos señales cubre todos los escenarios de ataque. Los autores enumeran honestamente dos tipos de fallos.

El primero: una referencia falsificada. Si el atacante controla el punto de referencia, puede elegir un estándar de modo que la diferencia base-to-candidate sea cero por construcción. Entonces ni siquiera es necesario entrenar el modelo: ambos ejes mostrarán la normalidad.

El segundo: un ataque white-box al umbral. Si el propietario de los pesos tiene acceso completo al modelo, puede fine-tunear el checkpoint deliberadamente para que quede fuera del límite de decisión, pero que siga siendo inseguro desde el punto de vista de los guardas y conserve la coherencia.

Precisamente por eso los autores denominan al enfoque un triage eficaz, no una protección contra la intervención. Permite descartar rápidamente checkpoints claramente limpios y sospechosos, pero no puede ser la única barrera de seguridad.

Conclusión: una herramienta para el primer filtro

La verificación de dos señales es buena porque solo requiere una referencia confiable y dos mediciones económicas, y el resultado es fácil de calibrar para un registro específico. Las principales limitaciones son la dependencia de un estándar atestiguado y la vulnerabilidad a un ataque white-box dirigido. Además, la estadística se ha recopilado hasta ahora en un solo registro, por lo que en arquitecturas muy diferentes la precisión podría variar. Aun así, para el ecosistema de pesos abiertos es un paso práctico: antes había que elegir entre pruebas superficiales de generaciones y la ingeniería inversa completa, y ahora existe una opción intermedia que puede utilizarse como primer filtro.

Preguntas frecuentes

Verificación de dos señales en checkpoints: detectando la ablación oculta y sus puntos débiles