考试里人人都接近满分时,很难判断谁真的更强。搜索智能体——会自己拆题、查网页、追线索并综合证据的 AI——正遇到这个问题:据美团技术团队介绍,顶尖模型在 BrowseComp 上已从约三成升至九成以上,旧题越来越拉不开差距。
LoHoSearch 的新意,是用知识图谱来出题。知识图谱把人物、作品、地点等连成关系网络;系统可据候选实体数量和关系结构,分别控制“要排查多少对象”与“要同时满足多少条件”。团队从覆盖 762 万个维基百科实体、2.65 亿条有向边的图谱生成题目,经自动验证和人工复核后留下 544 道,覆盖 11 个领域。
一个直观结果是:同一 DeepSeek-V4-Flash 解题时,平均工具调用从 BrowseComp 的 35 次增至 LoHoSearch 的 61 次,准确率则从 58.84% 降至 10.02%。这说明它测到的不只是“能否搜到”,还有长链搜索中能否保存和组织线索。不过这些结果目前来自团队自述;LoHoSearch 更重要的价值,是让题目难度有明确刻度,方便判断进步究竟发生在哪里。