Paper 100 |多階段對話式段落檢索:從歷史脈絡精準抓取對話意圖
—

Paper 100 |多階段對話式段落檢索:從歷史脈絡精準抓取對話意圖

閱讀 2020 論文 Multi-Stage Conversational Passage Retrieval。本篇進一步將對話式檢索推向多階段架構,探討如何在長對話中,過濾掉閒聊與無關雜訊,精準檢索出能回答使用者當下需求的段落。


延續第 099 篇對於對話式搜尋的探討,這篇發表於 ACM 2020 的論文,進一步提出了一個更完整的**多階段檢索架構(Multi-Stage Retrieval)**來應對複雜的對話情境。


參考資料

  • 論文名稱:Multi-Stage Conversational Passage Retrieval
  • 出處:arXiv:2005.02230 / ACM 頁面
  • 領域:檢索、RAG 架構

一、論文核心:多階段過濾雜訊

在真實情境中,對話歷史包含了許多閒聊或是與當前問題無關的轉換。如果只是粗暴地把所有歷史對話全部塞進檢索模型裡,反而會引發「雜訊過載」,降低檢索準確度。

本篇論文提出了一套多階段架構:

  1. 歷史重要性評估:先判斷先前的對話輪次(Turns)對於當下問題是否有關聯。
  2. 初步檢索(First-stage Retrieval):利用稀疏檢索(如 BM25)快速從海量文件中撈出候選段落。
  3. 精細重排(Passage Re-ranking):結合萃取出的歷史關鍵脈絡與當下問題,運用深度模型對候選段落進行重新排序,確保最相關的答案排在第一位。

二、對企業 Agent 知識庫的啟發

這套多階段架構,正是如今高階 RAG 系統的標準配置。在企業應用中(例如跨部門 Agent 查閱過往簽呈或專案報告),我們不能只依賴單一的向量檢索(Dense Retrieval)。

借鏡這篇論文的做法,我們應該在 Agent 檢索模組中實作:

  • 混合檢索(Hybrid Search):結合 BM25 與向量檢索。
  • Re-ranker 模組:在拿到初步資料後,再交由另一個專門排序的模型,甚至讓 LLM 根據上下文判斷文件關聯度。 這能大幅減少 Agent 抓錯資料導致「幻覺」的風險。

免責聲明: 本文為論文閱讀與技術研究筆記。詳細的模型架構與實驗數據請參閱論文原文。