1
PsychJail: Exploring Psychological Jailbreaks via Multi-Turn Persuasion of LLM Policies
多轮说服步步攻心,揭秘LLM越狱新路径,AI安全防线面临心理战术挑战。
arXiv:2608.23028v1 Announce Type: new Abstract: Large language models (LLMs) are increasingly deployed in education, healthcare, policy advising, and …