1
PAM: Training Policy-Aligned Moderation Filters at Scale
大规模训练策略对齐的内容审核过滤器,让AI审核更贴合平台规则。
arXiv:2505.19766v4 Announce Type: replace Abstract: Large language models (LLMs) remain vulnerable to misalignment and jailbreaks, making external saf…