Crossing the Margin Cliff: Toward Relearn-Robust LLM Unlearning via Margin Calibration
十四种后处理都扛不住20条样本复学攻击?这项研究用边界校准让LLM遗忘跨过悬崖、真正稳固。
arXiv:2607.27836v2 Announce Type: replace Abstract: Large language model unlearning is consistently fragile under relearn attacks. On TOFU, fine-tunin…