1
卡迪夫大学新研究:AI 尚无法像人类教师一样可靠地批改作业
卡迪夫大学实测ChatGPT批改50篇论文,结果分数波动大,尚难替代真人教师。
IT之家 8 月 24 日消息,据外媒 Phys.org 今天(24 日)报道,卡迪夫大学和墨尔本大学的一项新研究发现,生成式人工智能(GenAI)目前还无法像人类教师一样可靠地评判学生的书面作业。 研究人员使用 ChatGPT 的两个版本,对 50 篇生物科学专业本科生论文进行评分,以测试大模型评…
卡迪夫大学实测ChatGPT批改50篇论文,结果分数波动大,尚难替代真人教师。
IT之家 8 月 24 日消息,据外媒 Phys.org 今天(24 日)报道,卡迪夫大学和墨尔本大学的一项新研究发现,生成式人工智能(GenAI)目前还无法像人类教师一样可靠地评判学生的书面作业。 研究人员使用 ChatGPT 的两个版本,对 50 篇生物科学专业本科生论文进行评分,以测试大模型评…
探讨LLM缩放能否提升社会模拟的保真度,揭示当前范式的局限与挑战
arXiv:2607.02464v1 Announce Type: new Abstract: Large Language Model (LLM) social simulations are a promising research method, but they are not yet fa…
自进化大模型代理真的忠实于过往经验?首项系统性因果研究揭开真相。
arXiv:2601.22436v3 Announce Type: replace Abstract: Self-evolving large language model (LLM) agents continually improve by accumulating and reusing pa…