1
Prompt Perturbation for Reliable LLM Evaluation over Comparison Graphs
用提示扰动比较图提升LLM评估可靠性,新方法应对排序不一致。
arXiv:2606.17634v1 Announce Type: new Abstract: Evaluating large language models (LLMs) is important for understanding their capabilities, comparing c…