Perplexity 公開 Q2D-Web:一億九千萬網頁語料評測代理式 RAG 檢索,Leaderboard 開放提交

重點摘要

2026 年 9 月 9 日,Perplexity 工程團隊在官方部落格宣布推出 Q2D-Web(Query2Doc-Web):一套面向 代理式 RAG(agentic RAG) 第一階段檢索器的大規模基準與公開排行榜。內容經核對自 Perplexity Hub 產品頁、配套 arXiv 預印本(2609.08887)及 Hugging Face Spaces 排行榜說明,與 X 官方帳號發文一致。本文整理基準設計、評測機制、初步結果,以及對企業檢索與私有知識庫落地的啟示。

Perplexity 公開 Q2D-Web:一億九千萬網頁語料評測代理式 RAG 檢索,Leaderboard 開放提交

Perplexity 公開 Q2D-Web:一億九千萬網頁語料評測代理式 RAG 檢索,Leaderboard 開放提交

2026 年 9 月 9 日,Perplexity 工程團隊在官方部落格宣布推出 Q2D-Web(Query2Doc-Web):一套面向 代理式 RAG(agentic RAG) 第一階段檢索器的大規模基準與公開排行榜。內容經核對自 Perplexity Hub 產品頁、配套 arXiv 預印本(2609.08887)及 Hugging Face Spaces 排行榜說明,與 X 官方帳號發文一致。本文整理基準設計、評測機制、初步結果,以及對企業檢索與私有知識庫落地的啟示。

一、核心事件:為何現有檢索基準不夠用

技術細節

生產級 RAG 管線的第一階段,往往要在以十億計的網頁中,為每條查詢撈出數千名候選文件;這些候選決定了下游代理「看得到」哪些證據。Perplexity 指出,現實評測必須同時放大三個維度:語料規模已標註查詢數量,以及每條查詢的相關判斷深度

現有公開基準通常只在其中一至兩項達標:網頁級語料往往查詢偏少;查詢很多的基準語料又通常只有數百萬文件;且多數仍以人類撰寫查詢為主,與代理改寫後的搜尋語句分布不同。Q2D-Web 的定位,正是補上這個缺口。

據官方說明,Q2D-Web 包含:

  • 1.9 億 篇網頁文件語料
  • 69,721 條由代理改寫的搜尋查詢,覆蓋 十種語言(英語約佔 65.8%
  • 在 Combined 判斷集上,平均每條查詢約有 99.6 個正相關標註

語料並非隨機抽樣:系統為每條查詢取生產檢索的前 5,000 筆結果,再經 MinHash–LSH 去重(token 5-gram Jaccard ≥ 0.975),刻意保留「主題相近但漏掉日期、實體、版本等關鍵條件」的困難干擾項。

二、技術原理深度解析

三套相關判斷,避免單一標註偏誤

大規模下不可能標滿所有 query–document 對。Q2D-Web 因此提供三套固定相關判斷:

  1. Citation:代理在回覆中實際引用的文件(高精度、低召回)
  2. Web Ranking:內部檢索棧(BM25 + 稠密檢索 + cross-encoder rerank)為每查詢選出最多 50 篇(平均約 43.1)
  3. Combined + LLM-Judged:合併前兩者,再對未標註候選以 DeepSeek-V4-Flash 做嚴格二元相關判斷,降低假陰性

主指標採用 Recall@1000:第一階段只需把相關文件送進候選池,最終排序留給後續 reranker。

以 RRF 子語料控制評測成本

全語料評測極昂貴:官方舉例,以 pplx-embed-v1-4b 跑完整語料約需 4,608 H200 GPU-hours。團隊以 reciprocal rank fusion(RRF)抽樣子語料,僅用全語料約 31.7% 文件,即可大致維持模型名次,平均 Recall@1000 膨脹僅約 4.5 點(同規模隨機抽樣約膨脹 11.1 點)。提交流程為:先在子語料評測,按參數量分為 ≤1B 與 >1B 兩組,進入組內前十者再跑全語料。

初步排行榜觀察(十三款公開檢索模型)

官方表格顯示,沒有單一模型囊括三套判斷集第一:

  • Recall@1000/Web Rankingpplx-embed-v1-4b 65.73
  • Recall@1000/Combinedpplx-embed-v1-4b 69.11
  • Recall@1000/CitationNemotron-3-Embed-8B 61.68

同系列內,較大模型在 Combined Recall@1000 通常更高(例如 Qwen3-Embedding 由 0.6B 的 57.89 升至 8B 的 64.53)。Perplexity 亦提醒:基準源自其生產流量,自家嵌入模型可能具有分布內優勢,解讀時應保留此一前提。

公開模型可經官方表單提交 Hugging Face 倉庫;評測跟從模型卡設定,查詢與文件一律截斷至 512 tokens,並偏好 trust_remote_code=False

四、日常應用場景

1. 開發者與技術團隊

可用 Q2D-Web 比較稠密檢索、晚期交互與傳統 BM25 在「代理改寫查詢」下的真實差距,避免只靠 MS MARCO 等人類查詢基準做選型。Leaderboard 亦要求模型卡寫清 pooling、正規化與相似度函式,有助可重現實驗。

2. 企業與隱私敏感行業

金融、法律、醫療若要建內部 RAG,第一階段檢索品質直接影響幻覺與合規風險。企業可借鑒「多來源相關判斷+困難干擾項」思路,為自家語料設計評測,而不是只看 demo 滿意度。

3. 一般用戶

一般用戶較少直接接觸 Leaderboard,但會感受到結果:搜尋或 AI 助理是否引用「看起來相關、其實答錯版本」的網頁。基準若能逼出更好的第一階段檢索,下游答案的證據質量會同步改善。

4. 香港與亞洲市場視角

Q2D-Web 覆蓋十語,含中文、日文、韓文等,對香港團隊服務粵語/書面中文與跨境客戶有參考價值。本地金融與專業服務機構若部署私有 RAG,更應自建「香港法規、公司內部制度」導向的評測集,而不是只追蹤英文公開榜。

五、專業評價與潛在考量

優勢

  • 同時放大語料、查詢量與標註深度,贴近生產代理式搜尋
  • 三套相關判斷降低單一標註管線偏誤
  • RRF 子語料讓公開排行榜在成本上可行
  • 技術報告與 arXiv、公開表單形成可核實閉環

需要留意的地方

  • 語料來自 Perplexity 生產流量,外部模型與自家模型比較時須注意分布差異
  • Combined 集引入 LLM 判斷,標註本身亦可能帶模型偏好
  • 主打 Recall@1000,不等於端到端回答品質;企業仍需測引用正確率與拒答策略
  • 512 token 截斷對長文件場景可能低估部分長上下文模型

結語

Q2D-Web 把「代理會怎麼搜」寫進大規模網頁檢索評測,並用公開 Leaderboard 把嵌入模型的第一階段能力攤在陽光下。對正在把 RAG 與 AI 代理推進生產的團隊而言,這比再看一輪聊天 demo 更有決策價值。

若香港企業需要把類似能力落地到私有知識庫——從 Dataset、QLoRA/LoRA 微調到私有 API,並要求數據留在本地——可參考 YSK Limited 的企業私有 LLM 全託管(年費由 HK$88,000 起,100% 數據不出境):https://ysk.hk/services/ai-automation


參考來源

延伸閱讀 · 相關服務與產品