Revisiting Text Ranking in Deep Research

2026年02月25日
  • 简介
    深度研究已成为一项重要任务,旨在通过大规模开放网络探索来应对复杂查询。为解决该任务,现有主流方法通常为基于大语言模型(LLM)的智能体配备“黑盒式”网络搜索API,使其能够迭代地发起搜索请求、获取外部证据,并基于所获信息进行推理。尽管搜索在深度研究中扮演着核心角色,但此类不透明的网络搜索API却严重阻碍了对搜索各组成部分的系统性分析,致使当前主流文本排序方法在深度研究场景下的实际行为与表现仍缺乏清晰认知。为弥补这一空白,本文在深度研究设定下,复现并验证了一系列关键的检索(IR)文本排序方法的重要发现与最佳实践。具体而言,我们从以下三个维度考察其有效性:(i)检索单元(文档级 vs. 段落级);(ii)检索流程配置(不同检索器、重排序器及其重排序深度);(iii)查询特征(智能体生成的查询与文本排序模型训练时所用查询之间存在的语义与形式错配)。我们在BrowseComp-Plus数据集上开展实验——这是一个具有固定语料库的深度研究基准数据集,涵盖2个开源智能体、5种检索器与3种重排序器,并在多种实验配置下进行全面评估。实验结果表明:智能体生成的查询通常采用网页搜索风格的语法结构(例如带引号的精确匹配),因而更适配词法检索器、学习型稀疏检索器以及多向量检索器;在上下文窗口受限的情况下,段落级检索单元更具效率,且可规避词法检索中因文档长度差异带来的归一化难题;重排序环节效果极为显著;而将智能体生成的查询显式转化为自然语言问句,则能显著弥合前述查询错配问题。
  • 作者讲解
  • 图表
  • 解决问题
    在深度研究(deep research)任务中,现有LLM代理依赖黑盒式网络搜索API,导致无法系统分析检索组件(如文本排序方法)的行为;尤其缺乏对IR文本排序技术在代理生成查询、受限上下文窗口、文档/段落粒度选择及查询-训练分布不匹配等现实约束下的实证验证。该问题并非全新,但首次在可控、固定语料的深度研究基准上系统复现并解构经典IR方法的有效性。
  • 关键思路
    摒弃端到端黑盒搜索,将深度研究解耦为可分析的检索流水线(检索器+重排器),在统一实验框架下系统评估三大维度:(1)检索单元(段落优于文档,缓解长度归一化与上下文限制问题);(2)流水线配置(多向量检索器与重排器协同效果突出);(3)查询适配(将代理生成的语法化查询(如带引号精确匹配)翻译为自然语言问题,显著缓解与预训练排序模型的查询分布偏移)。核心新意在于将传统IR最佳实践‘迁移’并‘诊断性验证’于LLM代理驱动的开放域研究场景。
  • 其它亮点
    实验基于开源、固定语料的BrowseComp-Plus数据集,覆盖2个开源代理(WebThinker、AgentSearch)、5个开源检索器(BM25、SPLADE、ColBERTv2、Jina-Embeddings-v2、BGE-M3)和3个重排器(Cross-Encoder、MonoT5、RankVicuna);关键发现包括:段落级检索在有限上下文下更高效;重排带来显著增益(+15–22% Recall@5);查询翻译(agent-query → NL question)平均提升NDCG@10达31.7%;所有代码、配置与分析已开源;未来方向包括:构建面向LLM代理查询特性的专用排序模型、动态检索单元选择机制、轻量级实时重排器设计。
  • 相关研究
    Learning to Rank for Large Language Models (SIGIR '24); RAG-Rank: Improving Retrieval-Augmented Generation via Learned Ranking (ACL '23); Query2Doc: Query Expansion with LLMs for Effective Retrieval (EMNLP '23); The Effectiveness of Dense Retrieval in Agent-Based Web Search (NeurIPS '23 Workshop); ColBERTv2: Effective and Efficient Retrieval via Lightweight Late Interaction (TMLR '23)
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问