1
Clinician-Level Agreement Without Clinical Caution: LLM Evaluator Limits in Medical AI Benchmarking
医学AI评测中,LLM评估器虽与临床医生高度一致,却缺乏临床谨慎,这一隐患值得警惕。
arXiv:2607.01103v1 Announce Type: new Abstract: Open-response evaluation provides stronger clinical validity than multiple-choice benchmarks but creat…