1
BayesBench: Evaluating LLM Belief Trajectories Under Multi-Turn Evidence Accumulation
多轮对话中模型信念如何随证据更新?新基准BayesBench专测LLM贝叶斯推理轨迹
arXiv:2606.30850v1 Announce Type: new Abstract: Large language models (LLMs) are typically deployed in multi-turn conversations, where each turn provi…