Calibração de margem versus re-treinamento: como manter o esquecido esquecido
Pesquisadores descobriram que os métodos padrão de desaprendizado de LLMs quebram facilmente quando refinados com um pequeno número de exemplos esquecidos. A técnica proposta por eles, Margin Calibration, adiciona uma penalidade de margem não saturante e reduz significativamente o sucesso desses ataques em diferentes modelos e conjuntos de dados.








