Paper 012 |不加標註、不換更大模型,只多一個「視角」:讓 T5-large 打平 3.6 倍大的 T5-3B

Paper 012 |不加標註、不換更大模型,只多一個「視角」:讓 T5-large 打平 3.6 倍大的 T5-3B

閱讀 SIGIR 2021 論文 Text-to-Text Multi-view Learning for Passage Re-ranking。如果說上一篇 ai-097(MMLF)管的是檢索的第一段「粗撈」,這篇管的就是第二段「精排(re-ranking)」。它的招數是多視角學習:在原本的「排序視角」之外,additionally 加一個「文字生成視角」(讓模型從段落反推出查詢),兩個目標共享同一個 T5 表徵一起訓練。結果是——不需要更多標註資料、也不用換更大的模型,就讓 T5-large 的精排效果追平參數量大 3.6 倍的 T5-3B。


上一篇 ai-097(MMLF)我留了一個伏筆:現代檢索通常是兩段式——先「粗撈」一大批候選(要 Recall 高、別漏),再「精排」把最相關的排到最前面(要排序準)。MMLF 做的是第一段。

這篇 ai-098 做的正是第二段:passage re-ranking(段落重排序)。它假設第一段(例如 BM25)已經撈回一批候選,任務是把這批候選重新排一次,讓真正相關的排在最前面。

兩篇合起來,剛好拼出一條完整的檢索管線:

第一段 粗撈(MMLF, ai-097)→ 第二段 精排(本篇, ai-098)→ 最終排名

這篇的巧思是:精排模型要更準,一般靠「堆更多標註資料」或「換更大的模型」。但它走第三條路——多視角學習(multi-view learning):不加資料、不換大模型,只是多給模型一個「看事情的角度」。


參考資料與研究團隊


一、先補幾個名詞

延續 ai-097 的檢索術語,這篇再多幾個。

名詞白話說明
Re-ranking(重排序/精排)兩段式檢索的第二段:把第一段撈回的候選重新排一次,讓相關的更靠前
T5一種 text-to-text 的預訓練模型;所有任務都變成「輸入一段文字 → 輸出一段文字」
MRR@10評分指標:相關文件排在越前面分數越高(見下方說明)
MS MARCO大型段落排序資料集,含 880 萬段落,IR 領域標準測試
多視角學習讓模型從多個「角度」學同一個對象,representations 更全面(源自電腦視覺)
P2Q(passage-to-query)文字生成任務:給一段內文,反過來生成出它對應的查詢

MRR@10 是什麼:對每個查詢,看第一個相關文件排在第幾名,取名次的倒數(排第 1 拿 1 分、排第 2 拿 0.5 分、排第 3 拿 0.33 分…,掉出前 10 名就 0 分),再對所有查詢平均。它專門獎勵「把對的答案排到最前面」,很適合評精排。


二、核心概念:幫模型多開一個「視角」

先講「單視角」的傳統做法。精排模型(這裡是 T5)只學一件事——排序視角(Rank view):給一個「查詢+段落」配對,判斷相不相關(輸出 true / false)。

作者的洞見是:同一個「查詢—段落」配對,其實可以從兩個角度理解:

  1. 排序視角(Rank):這個段落和這個查詢相不相關?(判斷 true/false)
  2. 文字生成視角(P2Q):給這個段落,能不能反推出它對應的查詢?(生成一句 query)

這兩件事其實在描述同一種關係(段落與查詢的對應),只是方向不同。作者主張:讓 T5 用同一份共享表徵同時學這兩個視角,學到的表徵會更穩健、更能舉一反三——而且完全不需要額外的人工標註,也不用換更大的模型。

這正好呼應 ai-092ai-093 那條線的老精神:與其堆量(更多資料、更大模型),不如讓既有訊號被更充分地利用。


三、方法:兩個目標,一個混合比例

實作建立在 T5 上,同時訓練兩個損失(loss),用一個「混合比例(mixing rate)λ」加權:

總損失 = (1 − λ) × 排序損失(Rank) + λ × 生成損失(P2Q)
  • 排序損失:讓模型對「相關段落」輸出 true、「不相關段落」輸出 false。
  • 生成損失(P2Q):讓模型看著段落,逐字生成出對應的查詢。
  • λ(mixing rate)=文字生成範例佔總訓練範例的比例。λ 越大,生成視角的比重越高。

訓練時用「混合抽樣」把兩種視角的範例按比例混著餵給同一個 T5。作者在 T5-large 上搜出最佳 λ=0.15(即約 15% 的訓練範例來自生成視角)。

Loading Diagram...

四、實驗設定

  • 資料集:MS MARCO 段落排序(880 萬段落)。
  • 驗證集 Dev:6,980 個查詢(調參與分析用);測試集 Dev-Rest:51,836 個查詢(驗證泛化)。
  • 指標:MRR@10(對齊官方排行榜)。
  • 兩段式管線:第一段用 BM25 粗撈候選 → 第二段用 T5 精排。
  • 三種模型大小:T5-base(2.2 億參數)、T5-large(7.7 億)、T5-3B(28 億)。
  • 每個設定用不同隨機種子微調 10 次,取最佳。

五、主結果:中模型追平大 3.6 倍的模型

單視角(只有 Rank)對比多視角(Rank + P2Q)的 MRR@10:

模型參數量單視角 Dev多視角 Dev單視角 Dev-Rest多視角 Dev-Rest
T5-base2.2 億0.3840.3850.3800.382
T5-large7.7 億0.3950.4010.3900.393
T5-3B28 億0.3980.4020.3950.396

(BM25 單獨的 MRR@10 只有 0.187,兩段式加上 T5 精排後大幅拉高,可見精排的重要。)

兩個重點:

  1. 多視角一致優於單視角:三種大小都有提升,其中 T5-large 進步最多(Dev +0.006)。
  2. 最關鍵的發現:多視角的 T5-large(0.401)追平了單視角的 T5-3B(0.398)——但 T5-large 只有 7.7 億參數,是 T5-3B(28 億)的不到三分之一。等於用「多一個視角」換到了「模型放大 3.6 倍」才有的效果。

對要控成本的人來說,這個結論很實在:與其硬上更大的模型(更貴、更慢),不如用多視角把中型模型的潛力榨出來。


六、成分分析:到底是哪個視角在幫忙?

作者做了一個很漂亮的對照,確認「贏」不是隨便加個第二任務就有的,而是特定的 P2Q 視角在起作用(λ 固定 0.15,MRR@10):

第二個視角MRR@10
無(只有 Rank,baseline)0.393
再加一個 Rank(同視角複製)0.391(沒幫助,甚至略降)
加 P2Q(段落→查詢生成)0.399(最佳)
加 Q2P(查詢→段落生成)0.394(幫助有限)

結論很清楚:

  • 把排序視角複製一份當第二視角 → 沒用(0.391)。所以不是「多一個任務」就好。
  • 必須是互補的生成視角 P2Q(從段落反推查詢)→ 才有效(0.399)。
  • 連方向都有講究:P2Q(段落→查詢)比 Q2P(查詢→段落)更有幫助。

這證明多視角的效果來自「視角要真的不同、要互補」,呼應了 ai-097 那句——多樣性要是真的多樣才有價值。

另外作者也觀察到:候選數 K 從 10 掃到 1000 時,多視角的優勢越來越大。也就是候選越多、雜訊越大的環境,多視角越能幫模型從雜訊中挑出相關段落。


七、這篇對「做 RAG 系統」的人有什麼用

ai-097 和這篇疊起來看,你的財報/ERP 問答檢索其實有兩段可以各自優化:

階段對應論文目標可用技巧
第一段 粗撈ai-097 MMLF別漏(Recall 高)多查詢 + RRF 晚融合
第二段 精排本篇排得準(MRR 高)T5 精排 + 多視角學習

兩個可帶走的實務觀念:

  1. 精排這一段值得投資:BM25 單獨 0.187,加上 T5 精排跳到 0.4 左右——第二段的品質對最終體驗影響巨大。
  2. 不一定要用更大的模型:多視角學習示範了「用訓練技巧換效能」的路。資源有限時,先想怎麼把中型模型榨乾,再考慮換大模型。

八、研究限制

以下為筆者閱讀後整理,部分原文明述、部分為個人判讀。

8.1 提升幅度偏小

多視角的絕對提升多在 0.001~0.006 之間。它的價值主要在「用小模型達到大模型效果」的效率面,而非把天花板大幅推高。

8.2 混合比例要調

最佳 λ=0.15 是在 T5-large 上搜出來的,T5-base 與 T5-3B 因算力限制直接沿用同一個 λ,未必各自最佳。換資料集或領域,λ 大概要重調。

8.3 只驗證英文段落排序

實驗只在 MS MARCO(英文)上。套到繁中財報/ERP 文件的精排,效果仍需自行驗證——這點和 ai-097 相同。

8.4 P2Q 視角依賴標註配對

生成視角需要「查詢—相關段落」配對來訓練。雖然不需要「額外」標註(用既有的相關配對即可),但完全沒有標註配對的場景就不適用。


九、總結

  • 這篇做的是兩段式檢索的第二段:passage re-ranking(精排),與 ai-097(第一段粗撈)互補。
  • 核心方法是多視角學習:在排序視角之外,additionally 加一個 P2Q(段落→查詢)的文字生成視角,兩者共享同一個 T5 表徵一起訓練。
  • 用混合比例 λ 加權兩個損失,最佳 λ=0.15。
  • 主結果:多視角一致優於單視角;最亮點是多視角 T5-large(0.401)追平單視角 T5-3B(0.398),參數量卻只有約三分之一。
  • 成分分析證明:要用互補的 P2Q 視角才有效,複製排序視角或改用 Q2P 都不行——視角要真的不同才有價值。
  • 代價:絕對提升不大、λ 要調、只驗證英文、生成視角需要既有標註配對。

一句話收束:

想讓模型更強,未必要餵更多資料或換更大的模型——有時只要教它「換個角度看同一件事」,中型模型就能追上大它三倍的對手。


參考資料

  1. Jia-Huei Ju, Jheng-Hong Yang, and Chuan-Ju Wang. Text-to-Text Multi-view Learning for Passage Re-ranking. SIGIR 2021.
  2. Colin Raffel et al. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer (T5). JMLR 2020.
  3. Rodrigo Nogueira et al. Document Ranking with a Pretrained Sequence-to-Sequence Model (monoT5). Findings of EMNLP 2020.
  4. Payal Bajaj et al. MS MARCO: A Human Generated MAchine Reading COmprehension Dataset. 2016.

免責聲明: 本文為論文閱讀與技術研究筆記。所述精排方法與實驗數據僅供技術研究參考,實際套用於不同語言或領域(如繁中財報、ERP 文件)的效果仍需自行驗證。