1
Mechanistically Eliciting Latent Behaviors in Language Models
语言模型的隐藏行为能否被机制性引导?这项研究给出新路径,关乎AI安全与可解释性。
arXiv:2606.29604v1 Announce Type: new Abstract: We aim to discover diverse, generalizable perturbations of LLM internals that can surface hidden behav…