1
See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL
提出视觉证据预对齐框架,用充分性驱动的强化学习先看后答,提升多模态推理的可靠性与泛化能力。
arXiv:2606.17678v1 Announce Type: cross Abstract: Multimodal large language models (MLLMs) integrate strong text reasoning with visual inputs, yet the…