1
StatEval: A Comprehensive Benchmark for Large Language Models in Statistics
首个覆盖统计全流程的大模型评测基准,从数据分析到推断决策一站看清模型统计能力。
arXiv:2510.09517v2 Announce Type: replace Abstract: Despite rapid advances in large language models (LLMs), statistical reasoning remains underreprese…