1
Detect, Unlearn, Restore: Defending Text Summarization Models Against Data Poisoning
针对摘要模型微调时的数据投毒攻击,提出检测-遗忘-恢复三步防御框架,安全研究必备。
arXiv:2606.26036v1 Announce Type: new Abstract: Training-time data poisoning during fine-tuning poses a significant threat to large language models (L…