1
Staying VIGILant: Mitigating Visual Laziness via Counterfactual Visual Alignment in MLLMs
多模态大模型为何“视而不见”?反事实对齐技术直击视觉懒惰,提升视觉推理可信度。
arXiv:2606.26387v1 Announce Type: cross Abstract: Multimodal large language models (MLLMs) extend large language models (LLMs) with visual perception,…