AI 新闻

美团LongCat发布LoHoSearch:更难搜索智能体基准

X:美团 LongCat (@Meituan_LongCat) ·

AI 摘要

美团LongCat推出LoHoSearch,一个基于762万实体维基百科知识图谱自动生成问题的搜索智能体基准,旨在解决BrowseComp等现有基准趋于饱和的问题。在11个前沿模型测试中,最佳得分仅34.74%,远低于当前模型在BrowseComp上约90%的成绩;上下文策略仅带来+6.8个百分点的提升。该基准包含544道问题、11个领域,采用树与图结构,已开源。

BrowseComp 在 10 个月内从 30% 提升到了 90%。

搜索智能体基准测试正在趋于饱和。

因此我们构建了 LoHoSearch:一个更难的搜索智能体基准测试,其问题是从包含 762 万个实体的维基百科知识图谱中自动生成的,而非由人类编写。

它在搜索空间和结构复杂度上达到了人类标注者无法可靠设计的极限。

在 11 个前沿模型上的结果: → 最佳成绩:34.74%,接下来的 3 个模型集中在 15–16% 左右——而顶尖模型目前在 BrowseComp 上得分约为 90% → 最佳上下文策略在此仅带来 +6.8 个百分点的提升——而在 BrowseComp 上则为 +14 个百分点

544 道问题。11 个领域。树状 + 图结构。

开源。🧵

论文