1
To Reason or to Fabricate: Reasoning Without Shortcuts via Hint-Anchored Pairwise Aggregation
大模型推理常走捷径编造答案,这项研究用提示锚定成对聚合,让推理回归真实逻辑。
arXiv:2606.29481v1 Announce Type: new Abstract: While reinforcement learning (RL) significantly enhances LLM reasoning, its efficacy is severely under…