Perplexity发布Agentic RAG检索基准Q2D-Web
Perplexity 发布了一个面向 Agentic RAG 系统第一阶段检索的大规模基准 Q2D-Web 1.9 亿网页文档、近 7 万条真实智能体改写的查询、每条查询平均约 100 个正例标注;...
Perplexity发布了首个针对智能体RAG检索的大规模基准,13个模型评测结果揭示不同模型在不同指标上的表现差异。
Perplexity推出Q2D-Web基准,包含1.9亿网页文档和近7万条智能体改写查询,每条查询平均约100个正例标注。该基准解决了现有评测的三个盲区:语料太小、标注太稀和查询不对。评测结果显示pplx-embed-v1-4b在Recall @1000指标上领先,而Nemotron-3-Embed-8B在nDCG @10上表现更优。
Perplexity 发布了一个面向 Agentic RAG 系统第一阶段检索的大规模基准 Q2D-Web 1.9 亿网页文档、近 7 万条真实智能体改写的查询、每条查询平均约 100 个正例标注;...
Perplexity 发布了一个面向 Agentic RAG 系统第一阶段检索的大规模基准 Q2D-Web 1.9 亿网页文档、近 7 万条真实智能体改写的查询、每条查询平均约 100 个正例标注;并公布了 13 个主流检索模型的评测结果。 Perplexity 工程博客 perplexity.ai/hub/blog/q2d-w… Q2D-Web 论文 arxiv.org/abs/2609.08887 # 为什么需要这个基准:三个系统性缺陷 现有检索评测的三个盲区,以往基准最多解决一两个,Q2D-Web 同时扩展了全部三个: · 语料太小 → 召回虚高。 生产检索面对的是海量“话题相关但缺关键细节”的强干扰文档;缩小语料等于删掉干扰项,指标自然好看。 · 标注太稀 → 好模型被冤枉。 MS MARCO 的人工抽查显示,70% 被检索到但未标注的段落其实相关。稀疏标注会把检索能力强误判为不相关。 · 查询不对 → 评测失真。 现有基准用人类写的查询,而 Agentic RAG 里真正发给检索器的是智能体改写后的查询,措辞和具体性都不同。 对比:最接近的 MS MARCO Web Search 是1 亿文档 / 9 千查询 / 每查询 1 个正例;Q2D-Web 是1.9 亿文档 / 7 万智能体查询 / 每查询平均 99.6 个正例;三个维度同时放大一到两个数量级。 # 基准是怎么构建的? 查询:来自 23000 次经过隐私处理的 Perplexity 生产搜索(9 个月、10 种语言,英语占 65.8%),共 69721 条智能体改写查询。一次“搜索”指智能体为一条用户消息发起的全部搜索工具调用,其中含一条主查询(复述用户需求)和若干支撑查询(换个说法、补背景、查相关实体),每条独立评测。隐私处理包括仅使用授权用户数据、PII 检测过滤,并剔除精确重复、过短、含搜索运算符(site:、引号短语)的查询。 语料:对每个查询取生产系统检索的 top 5,000 文档取并集,经 MinHash–LSH 去重(5-gram Jaccard ≥ 0.975 聚簇),得到约 1.9 亿文档。关键设计:这不是随机网页抽样,每个文档都曾是某条查询的合理候选——刻意保留了“主题匹配但缺少日期/实体/版本/数量等关键要素”的难干扰项。 三套标注集(这是方法论上最讲究的部分,用多套标注互相制衡单一管线的偏差): · Citation:智能体回答中实际引用的文档 · Web Ranking:内部 BM25+稠密检索、交叉编码重排后的 top 50 · Combined:前两者并集 + LLM 补判 # 降本工程:子语料采样 全量评测极其昂贵:pplx-embed-v1-4b 一次需 4,608 H200 GPU 小时。他们的解决方案是保留全部正例文档、只对未标注干扰项做采样,比较了随机采样、固定深度池化和按查询 RRF 三种策略。结果是 RRF 采样只用 31.7% 的文档就能保住全量语料上的模型排序,召回率仅虚高 4.5 个百分点(同规模随机采样虚高 11.1 个点),成本降到约三分之一(pplx-embed-v1-4b 降至约 1,500 GPU 小时,EmbeddingGemma-300M 降至 70 以内)。 实际评测流程因此是两级漏斗:所有提交模型先在子语料上评测(按参数量分 ≤1B 和 >1B 两组),只有进入本组前十的模型才获得全量语料评测。 # 评测结果:没有全能冠军 13 个模型、三套标注、两个指标(Recall @1000 为主指标——第一阶段只需把相关文档捞进候选池,排序交给重排器;nDCG @10 为辅)。关键发现: · Recall @1000 :pplx-embed-v1-4b 在 Web Ranking(65.73)和 Combined(69.11)上领先;Nemotron-3-Embed-8B 在 Citation 上领先(61.68)。 · Combined nDCG @10 上排序反转:Nemotron-3-Embed-8B(47.44)反超 pplx-embed-v1-4b(45.84)——Perplexity 自家模型在自己流量来源的基准上并非全面第一。 · 规模效应稳定:同系列内更大模型在 Combined Recall @1000 上一致更高(Qwen3-Embedding 0.6B→8B:57.89→64.53;Nemotron 1B→8B:61.68→68.58;pplx-embed 0.6b→4b:67.02→69.11)。 · 稀疏 BM25(tantivy 实现)的 Recall @1000 只有 44–45,与稠密模型差距明显;但这是 512 token 截断、1.9 亿文档难干扰项下的结果。 Perplexity @perplexity_ai We're introducing Q2D-Web (Query2Doc-Web), a benchmark and public leaderboard for evaluating retrieval in agentic RAG systems. Q2D-Web tests how embedding models perform on large-scale web search using agent-reformulated search queries. Read more: perplexity.ai/hub/blog/q2d-w… 🔗 View Quoted Tweet 💬 1 🔄 1 ❤️ 4 👀 365 📊 2 ⚡