Calibración de margen frente a reentrenamiento: cómo mantener lo olvidado, olvidado
Los investigadores descubrieron que los métodos estándar de desaprendizaje de LLM se rompen fácilmente al reentrenar con un pequeño número de ejemplos olvidados. La técnica propuesta por ellos, Margin Calibration, añade una penalización de margen no saturada y reduce notablemente el éxito de estos ataques en distintos modelos y conjuntos de datos.








