LoHoSearch - 美团LongCat发布的搜索智能体评测基准
LoHoSearch快速摘要
LoHoSearch是美团LongCat团队于2026年7月20日公开的搜索智能体评测基准,用于测试AI智能体在复杂信息检索、长程推理和上下文管理任务中的能力,通过知识图谱自动生成高难度问题,适用于大语言模型、AI Agent研究和搜索系统评估。
- 工具名称:LoHoSearch
- 开发公司:美团LongCat团队
- 发布时间:2026年6月17日发布技术论文,7月20日由官方公众号正式公开
- 主要功能:通过知识图谱自动生成复杂搜索任务,评估模型推理、检索和信息整合能力。
- 使用要求:需要结合搜索工具、网页浏览工具或AI Agent框架进行测试
- 开源情况:LoHoSearch数据集已公开,可通过Hugging Face获取544道人工验证问题。
- 适用场景:适用于搜索智能体评测、模型对比、上下文管理研究和复杂检索算法测试。
- 技术特点:基于覆盖762万个Wikipedia实体、2.65亿条关系边的知识图谱,通过搜索空间和结构复杂度控制难度。
- 价格信息:数据集开放获取,当前未公布商业API价格或付费服务。
LoHoSearch的核心优势
- 知识图谱自动生成:基于Wikipedia构建762万个实体和2.65亿条关系边,通过全局知识网络自动发现高难度搜索任务,减少人工出题限制。
- 双维度难度控制:结合搜索空间和结构复杂度设计任务,通过候选规模与多条件约束提升AI搜索智能体评测难度。
- 高区分度能力评估:测试数据显示GPT-5.5在LoHoSearch准确率为34.74%,可有效区分不同模型长程搜索推理能力。
- 长程推理能力测试:通过多步骤检索和隐藏实体推理评估Agent能力,正确轨迹平均需要61次工具调用。
- 上下文管理研究:支持测试Summary、Verify等策略,据实验数据显示最佳策略可提升DeepSeek-V4-Flash准确率6.8%。
LoHoSearch的主要功能
- 知识图谱任务生成:将Wikipedia实体和关系转换为复杂问题,自动生成隐藏答案的搜索任务,测试AI Agent检索能力。
- 搜索智能体评测:支持search和browse工具调用,通过准确率、工具次数等指标分析模型搜索推理性能。
- 复杂问题验证:采用自动验证与人工审核机制,筛选544道唯一答案问题,覆盖音乐、影视、地理等11个领域。
- 模型性能分析:提供准确率、校准误差、工具调用次数等数据,帮助研究不同AI模型能力差异。
- 上下文策略测试:支持评估长程任务中的信息管理方法,分析上下文压缩和验证策略实际效果。
LoHoSearch的技术原理
- 知识图谱架构:采用Wikipedia知识网络,将762万个实体作为节点、2.65亿条链接作为边,构建搜索任务基础。
- 自动采样机制:通过树结构和图结构生成问题,利用搜索空间与结构复杂度控制任务难度。
- 自然语言生成:利用大语言模型改写知识图谱关系,将实体约束转换为自然语言搜索问题。
- 答案验证机制:结合知识图谱校验、搜索Agent验证和人工审核,确保问题答案唯一可靠。
- Agent评测机制:模拟真实搜索流程,通过工具调用、推理轨迹和最终答案评估模型能力。
LoHoSearch与主流模型评测基准对比
| 对比维度 | LoHoSearch | BrowseComp |
|---|---|---|
| 任务生成方式 | 知识图谱自动生成+人工审核 | 人工设计问题 |
| 问题数量 | 544道人工验证问题 | 数百道任务 |
| 难度控制 | 搜索空间+结构复杂度双控制 | 人工经验控制 |
| 最高模型准确率 | GPT-5.5达到34.74% | GPT-5.5 Pro约90%以上 |
| 工具调用需求 | 平均61次调用 | 平均35次左右 |
| 上下文策略提升 | 最高提升6.8% | 最高提升14.03% |
LoHoSearch与BrowseComp均用于评测搜索智能体能力,但测试重点存在差异。BrowseComp采用人工设计题目,主要衡量模型的信息检索与多步搜索能力;LoHoSearch基于覆盖762万维基百科实体的知识图谱自动生成问题,通过搜索空间和结构复杂度控制难度,更侧重长程搜索推理与上下文管理能力。据论文测试显示,GPT-5.5在LoHoSearch上的准确率为34.74%,而DeepSeek-V4-Flash在BrowseComp上的准确率为58.84%、LoHoSearch上仅为10.02%,说明LoHoSearch对复杂约束、多轮工具调用和信息整合能力提出了更高要求。
如何使用LoHoSearch
- 加载数据集:通过Python datasets库加载meituan-longcat/LoHoSearch数据集,获取544道人工验证问题、标准答案、领域标签和子图结构,为搜索智能体评测准备测试数据。
- 配置评测环境:准备支持search和browse工具的AI搜索智能体,将模型上下文设置为200K tokens左右,模拟论文中的标准测试环境,确保Agent能够完成多步骤检索任务。
- 执行智能体测试:将LoHoSearch问题输入待测AI Agent,让模型通过搜索、网页浏览和推理过程寻找答案,同时记录工具调用次数、推理轨迹和最终输出结果。
- 自动验证结果:使用评测流程检查模型答案是否满足问题中的全部关系约束,并结合标准答案计算准确率,分析模型在长程搜索任务中的实际表现。
- 分析评测数据:结合准确率、工具调用次数、子图复杂度和领域标签,对比不同模型在搜索空间、结构复杂度和上下文管理方面的能力差异。
LoHoSearch的局限性
- 题目规模有限:当前LoHoSearch包含544道人工验证问题,虽然覆盖11个领域,但相比开放世界知识规模仍有限,原因在于人工审核需要成本。
- 依赖知识图谱质量:LoHoSearch基于Wikipedia关系数据构建,部分领域知识更新可能存在延迟,原因是知识图谱来源受原始数据影响。
- 评测环境限制:当前测试主要针对具备搜索和浏览工具的Agent,实时语音、多模态交互等能力未覆盖,原因是基准设计目标集中于搜索推理。
LoHoSearch相关资源
- HuggingFace模型库:meituan-longcat/LoHoSearch
- arXiv技术论文:https://arxiv.org/pdf/2606.12837
LoHoSearch的典型应用场景
- 搜索智能体评测:用于测试AI智能体在复杂信息检索、多步推理和长程搜索任务中的综合能力。
- 上下文管理研究:用于验证摘要、压缩、重启等策略在长链路搜索中的实际效果。
- 模型能力对比:通过统一测试标准评估不同AI模型的搜索推理性能和能力差异。
- 搜索算法优化:为多轮检索、工具调用和复杂约束推理算法提供实验数据支持。
- 智能体产品测试:帮助企业评估搜索型AI智能体在复杂场景中的适用能力。
LoHoSearch常见问题
LoHoSearch怎么用?
LoHoSearch需要结合AI搜索智能体使用,通过Hugging Face加载数据集,将问题输入支持search和browse工具的Agent,再统计答案准确率。
LoHoSearch如何计费?
LoHoSearch数据集目前免费开放使用,没有公布API价格或商业计费方案。
LoHoSearch和BrowseComp哪个好?
两者定位不同,LoHoSearch更适合测试长程搜索推理能力。根据论文数据,GPT-5.5在LoHoSearch准确率34.74%,任务工具调用需求更高;BrowseComp更适合基础搜索能力测试,选择时需根据评测目标决定。
LoHoSearch支持实时搜索吗?
LoHoSearch本身不是搜索工具,不提供实时搜索功能,而是评测数据集。使用时需要连接具备搜索能力的Agent。
-
07.24
免费的AI生成PPT:助你轻松应对职场挑战
-
07.24
怎么用AI总结PPT:提升工作效率的秘密武器
-
07.24
AI直接生成PPT: WPS AI如何改变你的工作方式
-
07.24
生成PPT AI:轻松应对文档创作的高效之道
-
07.24
利用AI生成PPT配图的全新视角:如何让工作更轻松?
-
07.24
最好的AI生成PPT:轻松提升文档处理效率的秘密
-
-
下载
- |
-
-
下载
- 《行尸走肉第一章》免安装中文汉化硬盘版下载
- 单机|436 MB
- 一款以动作冒险为主题的游戏
-
-
下载
- 《街头霸王X铁拳》免安装中文汉化硬盘版下载
- 单机|111MB
- 一款非常好玩的格斗游戏
-
-
下载
- |
-
-
下载
- 《暗黑破坏神3》免安装繁体中文正式版下载
- 单机|7630 MB
- 一款以角色扮演为主题的游戏
-
-
下载
- 《马克思佩恩3》免安装硬盘版下载
- 单机|27033 MB
- 一款以第三人称射击为主题的游戏