CARE: Confidence-Aware Reasoning for Reliable Medical VQA
医疗视觉问答也能“知道何时不懂”,置信度感知推理让AI诊断更可靠
arXiv:2608.10964v1 Announce Type: new Abstract: Reinforcement Fine-Tuning (RFT) has enabled medical Multimodal Large Language Models (MLLMs) to produc…
医疗视觉问答也能“知道何时不懂”,置信度感知推理让AI诊断更可靠
arXiv:2608.10964v1 Announce Type: new Abstract: Reinforcement Fine-Tuning (RFT) has enabled medical Multimodal Large Language Models (MLLMs) to produc…
探索视频多模态大模型对人类运动推理能力的极限,最新基准测试揭示关键短板。
arXiv:2606.27999v1 Announce Type: new Abstract: Despite the rapid advance of Multimodal Large Language Models (MLLMs) in high-level video understandin…
医学视觉问答模型如何诚实表达“不确定”?这项研究提出新方法改善口头化不确定性校准,让AI在医疗场景中更可靠。
arXiv:2606.27023v1 Announce Type: new Abstract: Multimodal large language models (MLLMs) applied to Medical Visual Question Answering (VQA) tend to pr…
免训练实体识别新方法,先定位再排序,显著提升知识型视觉问答表现
arXiv:2606.23881v1 Announce Type: new Abstract: Knowledge-Based Visual Question Answering (KB-VQA) requires grounding visual queries to external knowl…
新基准用报告自动生成肿瘤学VQA任务,填补3D医学影像评估空白,推动视觉语言模型临床落地。
arXiv:2606.02809v1 Announce Type: new Abstract: Evaluating vision-language models (VLMs) on medical images requires benchmarks that are clinically gro…
首个全面评估多模态大模型对机械图纸理解的基准MechVQA,揭示现有模型短板并提出增强方案
arXiv:2605.30794v1 Announce Type: cross Abstract: Multimodal Large Language Models (MLLMs) have demonstrated significant achievements in general visua…
无需训练的病理AI智能体,用惊喜机制引导扫描并共享切片记忆,精准回答全切片图像问题。
arXiv:2605.23559v1 Announce Type: cross Abstract: Whole-slide image visual question answering (WSI-VQA) frames pathology as an extreme-context search …
首个专为脑肿瘤MRI解读打造的VQA数据集,助力医学影像AI研究新基准。
arXiv:2605.17140v1 Announce Type: cross Abstract: Brain tumor diagnosis is largely dependent on Magnetic Resonance Imaging (MRI) evaluation, which req…