1
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models
核工程领域首个结构化基准,检验大模型定量推理与概念理解,为高专业性AI评测立标杆。
arXiv:2606.27047v1 Announce Type: cross Abstract: Large language models (LLMs) have demonstrated strong performance across a wide range of tasks, but …