搜索智能体究竟有多强?过去一年,行业基本以browsecomp为唯一权威标尺。但这一衡量标准正迅速失效——仅用10个月,模型在该基准上的得分就从30%飙升至90%,测试本身的判别力正被快速耗尽。7月17日,美团longcat发布全新高难度评测集lohosearch,试图将搜索智能体重新拉回能力爬坡阶段。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

LoHoSearch的题目并非人工编写,而是完全基于一个包含762万个实体的维基百科知识图谱自动构造生成。正因其“机器出题”的底层逻辑,该评测在搜索空间广度与结构嵌套深度上,达到了人类标注者难以持续、稳定复现的极限难度。换言之,传统基准依赖人脑命题,再复杂也有认知边界;LoHoSearch则把命题权交给知识图谱,直接击穿了人为设定的难度天花板。

实测结果极为震撼:在11个当前最先进模型的统一测评中,最高分仅为34.74%,第二至第四名集中在15%–16%区间;而同一组模型在BrowseComp上的平均得分已逼近90%。如此悬殊的落差,清晰揭示出LoHoSearch对搜索智能体真实能力短板的穿透式检验力。更值得注意的是上下文策略的收益衰减:在LoHoSearch中,最优上下文调优仅带来6.8个百分点的性能提升,而在BrowseComp中同类操作可增益达14个百分点——这表明,单纯依赖提示工程与上下文堆叠的传统补救路径,在该新基准下已几近失效。
该评测集共含544道问题,覆盖11个垂直领域,所有问题均按树状与图状结构建模,并已全面开源。当旧有基准被刷至饱和,搜索Agent真正的技术攻坚才刚刚启幕。LoHoSearch,极有可能成为下一阶段不可绕行的核心评估门槛。











