1
Prompt engineering does not universally improve Large Language Model performance across clinical decision-making tasks
临床决策任务中,提示工程并非万能,三大模型实测效果颠覆直觉,调提示词前先看数据。
arXiv:2512.22966v2 Announce Type: replace Abstract: Large Language Models (LLMs) have demonstrated promise in medical knowledge assessments, yet their…