Data-DPO: Direct Preference Optimization for Target Model Data Selection in LLM Post-Training
数据选择新思路:用DPO偏好优化为模型量身筛选训练数据,提升后训练效果。
arXiv:2608.16926v1 Announce Type: new Abstract: Data selection in supervised fine-tuning aims to select a small set of effective samples from large-sc…