1
下一代搜索智能体评测基准!美团开源LoHoSearch,用知识图谱校准AI能力认知
过去一年,我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上,顶尖模型准确率从最初的 30% 区间迅速攀升至 90% 以上。然而,当基准迅速饱和,其区分模型能力的价值也随之递减。
过去一年,我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上,顶尖模型准确率从最初的 30% 区间迅速攀升至 90% 以上。然而,当基准迅速饱和,其区分模型能力的价值也随之递减。