1
Clinical Reasoning Graphs: Structured Evaluation of LLM Diagnostic Reasoning Reveals Competence Without Consistency
用临床推理图评估大模型诊断推理,揭示能力虽强但逻辑不稳定,医疗AI可靠性再受拷问。
arXiv:2606.29876v1 Announce Type: new Abstract: Modern large language models (LLMs) reach 60-70% diagnostic accuracy on complex clinical case benchmar…