1
ToxScreen: Detecting Whether an LLM Has Been Poisoned
针对大模型投毒攻击的检测新方法ToxScreen,通过分析模型行为判断是否被恶意篡改
arXiv:2607.26849v1 Announce Type: cross Abstract: As large language models (LLMs) are deployed in high-stakes domains, adversaries may poison training…