LoHoSearch - 美团推出的下一代搜索智能体评测基准
来源:互联网
时间:2026-07-21 14:27:08
LoHoSearch是什么
长话短说,LoHoSearch是美团LongCat团队推出的一款下一代搜索智能体评测基准。它的特别之处在于,不再依赖传统的人工出题模式,而是基于一个覆盖了762万维基百科实体、2.65亿条关系边的知识图谱来自动生成题目。基准收录了544道经过人工核验的高质量题目,横跨音乐、影视、地理等11个领域。通过控制搜索空间与结构复杂度这两个维度,它制造出了极具挑战性的评测任务。目前,最强模型GPT-5.5在其上的准确率仅为34.74%,远低于它在BrowseComp上超过90%的表现。这为长程搜索推理与上下文管理提供了一个更具区分度的评测标准。

LoHoSearch的主要功能
- :以完整英文维基百科为数据源,构建了包含762万实体节点与2.65亿条有向边的超大规模知识图谱。每个实体都标注了Wikidata类型与入度热度,为全局视角的选题提供了基础。
知识图谱自动化建图
- :从搜索空间与结构复杂度两个维度系统调控题目难度,突破了人工出题的认知天花板。
双维度难度控制
- :树结构通过放大搜索空间来制造难度,而图结构则在巨大搜索空间之上引入环形依赖与交叉约束,进一步叠加了结构复杂度。
树结构与图结构采样
- :从子图中抽取维基描述,改写为自然语言题目。经过关系提取、子图覆盖检查、答案满足度验证三层自动筛选,再辅以人工复核,确保题目质量。
自动化QA生成与验证
- :支持对主流搜索智能体进行标准化评测,输出准确率、工具调用次数、校准误差等核心指标,直观反映模型的长程推理能力。
多模型性能评测
LoHoSearch的技术原理
- :以完整英文维基百科为数据源,抽取762万个实体页面作为节点,提取正文中2.65亿条超链接作为有向边。每个实体都标注了Wikidata P31类型与入度热度,构建全局知识网络。
知识图谱自动化构建
- :从“搜索空间”和“结构复杂度”两个正交维度量化题目难度,突破人工出题的认知局限。
双维度难度定义
- :通过放大搜索空间制造难度。从单一答案节点向下展开多条独立分支,每条分支对应一个高候选空间的约束条件,使排除成本指数级上升。
树结构子图采样
- :在巨大搜索空间基础上引入环形依赖与交叉约束。多个条件节点彼此互联,求解必须同时满足多组咬合关系,叠加结构复杂度形成双重挑战。
图结构子图采样
- :从采样子图中抽取各实体的维基百科描述,用大模型改写为连贯的自然语言问题,确保每个线索完整保留原始子图中的关系信息。
关系提取与自然语言生成
如何使用LoHoSearch
- :通过
加载数据
datasets库直接加载meituan-longcat/LoHoSearch,获取544道题目与标准答案。 - :数据集包含题目文本、对应子图结构、领域标签,以及经知识图谱校验的唯一答案。
查看结构
- :将题目输入待测搜索智能体,记录其推理轨迹与最终输出。
接入评测
- :对照数据集提供的标准答案,验证模型输出是否满足全部约束条件,并统计准确率。
自动判分
- :利用数据集附带的子图复杂度与领域标签,分维度分析模型在不同难度与主题下的表现。
对比分析
LoHoSearch的核心优势
- :传统人工基准受限于标注者已知的实体范围,而LoHoSearch依托全局知识图谱,能够系统识别出高搜索空间与高结构复杂度的“真难题”。
突破人工出题天花板
- :同一模型在BrowseComp上准确率为58.84%,在LoHoSearch上仅为10.02%。平均工具调用次数从35次增至61次,挑战强度提升了74%。
难度显著高于现有基准
- :现有上下文管理策略在BrowseComp上能提升14.03%,在LoHoSearch上仅提升6.8%。这更能真实反映策略在长程复杂场景下的边际效益。
区分度更强
- :图结构题目的准确率(8.01%)显著低于树结构(11.89%),这证明结构复杂度是独立于搜索空间之外的额外难度来源,可以被单独量化。
结构复杂度独立可控
LoHoSearch的项目地址
- :https://huggingface.co/datasets/meituan-longcat/LoHoSearch
HuggingFace模型库
- :https://arxiv.org/pdf/2606.12837
arXiv技术论文
LoHoSearch的同类竞品对比
| 维度 | LoHoSearch | BrowseComp |
|---|---|---|
| 出题方式 | 知识图谱自动化生成 + 人工核验 | 人工设计 |
| 题目数量 | 544 道 | 数百道 |
| 覆盖领域 | 11 个领域(音乐、影视、地理等) | 未明确分领域 |
| 难度控制 | 搜索空间 + 结构复杂度双维度 | 人工主观控制 |
| 最强模型准确率 | GPT-5.5:34.74% | GPT-5.5 Pro:90.1% |
| 工具调用中位数 | 59 次 | 26 次 |
| 上下文策略提升 | +6.8% | +14.03% |
| 饱和状态 | 远未饱和,区分度高 | 已接近饱和 |
| 适用场景 | 长程搜索推理、上下文管理评测 | 基础搜索能力评测 |
LoHoSearch的应用场景
- :为具备长程推理能力的搜索Agent提供高难度标准化测试,精准定位模型在复杂信息检索链条中的短板。
搜索智能体能力评测
- :评估Summary、Discard-all、Verify等上下文压缩与验证策略在超长交互场景下的真实增益,避免在简单基准上高估策略效果。
上下文管理策略验证
- :为研究团队提供未饱和的评测标准,支撑模型版本迭代时的能力边界探测与性能对比。
模型迭代对标
- :为需要多步推理、交叉验证的复杂搜索算法研究,提供可控难度的数据集与评测框架。
搜索算法研究
- :帮助企业在选型搜索智能体方案时,通过LoHoSearch区分不同模型在真实复杂查询场景下的实际表现。
智能体产品选型