Leveraging Machine Unlearning for Cost-Efficient Preference Alignment
用机器遗忘替代昂贵的人类反馈,低成本实现大模型偏好对齐,ICML 2026新思路。
arXiv:2504.06659v2 Announce Type: replace-cross Abstract: Despite advances in Preference Alignment (PA) for Large Language Models (LLMs), mainstream m…