TRACE: Trajectory-Based Safety Patch Learning for LLM Post-Training Realignment
针对LLM后训练安全对齐,提出基于轨迹的安全补丁学习方法,提升模型对齐的可靠性与鲁棒性。
arXiv:2607.16242v1 Announce Type: cross Abstract: Fine-Tuning-as-a-Service (FTaaS) platforms let users train large language models (LLMs) on customize…