1
On-Policy Delta Distillation for Multilingual Math Reasoning
新方法让大模型多语言数学推理更强,策略蒸馏带来显著提升,值得一看。
arXiv:2608.05802v1 Announce Type: cross Abstract: On-Policy Distillation (OPD) is emerging as a promising alternative to reinforcement learning for LL…