Every AI Memory Benchmark Has an Asterisk
AI记忆基准测试的水分有多大?公开SOTA与实际复现差距20%,CTO的回应耐人寻味。
Article URL: https://tenureai.dev/writing/every-ai-memory-benchmark-has-an-asterisk/ Comments URL: https://news.ycombinator.com/item?id=48664538 Point…
AI记忆基准测试的水分有多大?公开SOTA与实际复现差距20%,CTO的回应耐人寻味。
Article URL: https://tenureai.dev/writing/every-ai-memory-benchmark-has-an-asterisk/ Comments URL: https://news.ycombinator.com/item?id=48664538 Point…
大语言模型在语言任务中称王,但面对符号、空间等非语言环境却表现不佳,研究揭示其本质局限
arXiv:2601.21754v3 Announce Type: replace Abstract: While Large Language Models (LLMs) excel in language-based agentic tasks, their applicability to u…
别再迷信合成数据,这项研究直指LLM个性化在真实用户场景下的性能短板,呼唤以人为中心的评估。
arXiv:2606.06614v1 Announce Type: cross Abstract: Despite growing interest, most evaluations of large language models' (LLMs') personalization abiliti…
从多序列心脏MRI评估中揭示多模态大模型在临床场景的真实性能差距,直击医疗AI应用痛点。
arXiv:2606.00123v1 Announce Type: cross Abstract: Multimodal Large Language Models (MLLMs) have shown strong performance on public medical benchmarks,…
研究发现LLM在多轮对话中表现远逊于单轮,但模型能通过自训练弥补这一差距,值得AI研究者关注。
arXiv:2605.24432v1 Announce Type: new Abstract: Large Language Model (LLM) interactions are typically underspecified, with users clarifying all necess…