Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning
推理时对齐新思路:用上下文学习先构造高质量候选,突破Best-of-N依赖生成质量的局限。
arXiv:2607.03453v1 Announce Type: cross Abstract: Inference-time alignment methods, such as Best-of-$N$, offer a flexible alternative to training-base…