MUD as AI Evaluation and LLM-judge distortion in ways aggregate κ misses
用MUD搭建AI评估场,揭露LLM裁判在聚合kappa指标下隐藏的失真,挑战传统评估框架的盲区。
Article URL: https://www.lesswrong.com/posts/GPbWyHgx9hCLMdAjc/mud-as-ai-evaluation-and-llm-judge-distortion-in-ways Comments URL: https://news.ycombi…