1
Evaluating medical AI under missing information: same-provider judges and human raters change apparent safety
医疗AI安全评估需警惕评判偏差:信息缺失下,同源评判者与人类评分员会改变结果分布,论文提出开放对话安全新标准。
arXiv:2607.18828v1 Announce Type: new Abstract: Readiness stress-testing of medical AI has focused on closed-ended and multimodal benchmarks. We exten…