1
Robust Critics: Defending LLMs Against Multi-Turn Attacks
让大模型不再“被套路”:多轮攻击通过动态推断用户意图实现防御。
arXiv:2607.20472v1 Announce Type: new Abstract: When a user asks a language model something harmful, is it a genuine attack or a misunderstood but wel…