1
PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models
直击大模型安全对齐痛点,PolicyAlign提出直接策略优化法,让模型既安全又少降性能。
arXiv:2606.25442v1 Announce Type: new Abstract: Safety alignment of large language models (LLMs) typically depends on high-quality supervision data, s…