
Paper 012 |不加標註、不換更大模型,只多一個「視角」:讓 T5-large 打平 3.6 倍大的 T5-3B
閱讀 SIGIR 2021 論文 Text-to-Text Multi-view Learning for Passage Re-ranking。如果說上一篇 ai-097(MMLF)管的是檢索的第一段「粗撈」,這篇管的就是第二段「精排(re-ranking)」。它的招數是多視角學習:在原本的「排序視角」之外,additionally 加一個「文字生成視角」(讓模型從段落反推出查詢),兩個目標共享同一個 T5 表徵一起訓練。結果是——不需要更多標註資料、也不用換更大的模型,就讓 T5-large 的精排效果追平參數量大 3.6 倍的 T5-3B。
WRITTEN BY

- Name
- Harry Chang
上一篇 ai-097(MMLF)我留了一個伏筆:現代檢索通常是兩段式——先「粗撈」一大批候選(要 Recall 高、別漏),再「精排」把最相關的排到最前面(要排序準)。MMLF 做的是第一段。
這篇 ai-098 做的正是第二段:passage re-ranking(段落重排序)。它假設第一段(例如 BM25)已經撈回一批候選,任務是把這批候選重新排一次,讓真正相關的排在最前面。
兩篇合起來,剛好拼出一條完整的檢索管線:
第一段 粗撈(MMLF, ai-097)→ 第二段 精排(本篇, ai-098)→ 最終排名
這篇的巧思是:精排模型要更準,一般靠「堆更多標註資料」或「換更大的模型」。但它走第三條路——多視角學習(multi-view learning):不加資料、不換大模型,只是多給模型一個「看事情的角度」。
- 參考資料與研究團隊
- 一、先補幾個名詞
- 二、核心概念:幫模型多開一個「視角」
- 三、方法:兩個目標,一個混合比例
- 四、實驗設定
- 五、主結果:中模型追平大 3.6 倍的模型
- 六、成分分析:到底是哪個視角在幫忙?
- 七、這篇對「做 RAG 系統」的人有什麼用
- 八、研究限制
- 九、總結
- 參考資料
參考資料與研究團隊
- 論文名稱:Text-to-Text Multi-view Learning for Passage Re-ranking(註1)
- 公開全文 PDF:arxiv.org/pdf/2104.14133
- 出處:SIGIR 2021(第 44 屆 ACM SIGIR 會議,短論文,5 頁)
- 主要研究人員:
- Jia-Huei Ju(朱家慧,中央研究院)
- Jheng-Hong Yang(楊正宏,University of Waterloo)
- Chuan-Ju Wang(王釧茹,中央研究院,資深作者)
一、先補幾個名詞
延續 ai-097 的檢索術語,這篇再多幾個。
| 名詞 | 白話說明 |
|---|---|
| Re-ranking(重排序/精排) | 兩段式檢索的第二段:把第一段撈回的候選重新排一次,讓相關的更靠前 |
| T5 | 一種 text-to-text 的預訓練模型;所有任務都變成「輸入一段文字 → 輸出一段文字」 |
| MRR@10 | 評分指標:相關文件排在越前面分數越高(見下方說明) |
| MS MARCO | 大型段落排序資料集,含 880 萬段落,IR 領域標準測試 |
| 多視角學習 | 讓模型從多個「角度」學同一個對象,representations 更全面(源自電腦視覺) |
| P2Q(passage-to-query) | 文字生成任務:給一段內文,反過來生成出它對應的查詢 |
MRR@10 是什麼:對每個查詢,看第一個相關文件排在第幾名,取名次的倒數(排第 1 拿 1 分、排第 2 拿 0.5 分、排第 3 拿 0.33 分…,掉出前 10 名就 0 分),再對所有查詢平均。它專門獎勵「把對的答案排到最前面」,很適合評精排。
二、核心概念:幫模型多開一個「視角」
先講「單視角」的傳統做法。精排模型(這裡是 T5)只學一件事——排序視角(Rank view):給一個「查詢+段落」配對,判斷相不相關(輸出 true / false)。
作者的洞見是:同一個「查詢—段落」配對,其實可以從兩個角度理解:
- 排序視角(Rank):這個段落和這個查詢相不相關?(判斷 true/false)
- 文字生成視角(P2Q):給這個段落,能不能反推出它對應的查詢?(生成一句 query)
這兩件事其實在描述同一種關係(段落與查詢的對應),只是方向不同。作者主張:讓 T5 用同一份共享表徵同時學這兩個視角,學到的表徵會更穩健、更能舉一反三——而且完全不需要額外的人工標註,也不用換更大的模型。
這正好呼應 ai-092/ai-093 那條線的老精神:與其堆量(更多資料、更大模型),不如讓既有訊號被更充分地利用。
三、方法:兩個目標,一個混合比例
實作建立在 T5 上,同時訓練兩個損失(loss),用一個「混合比例(mixing rate)λ」加權:
總損失 = (1 − λ) × 排序損失(Rank) + λ × 生成損失(P2Q)
- 排序損失:讓模型對「相關段落」輸出 true、「不相關段落」輸出 false。
- 生成損失(P2Q):讓模型看著段落,逐字生成出對應的查詢。
- λ(mixing rate)=文字生成範例佔總訓練範例的比例。λ 越大,生成視角的比重越高。
訓練時用「混合抽樣」把兩種視角的範例按比例混著餵給同一個 T5。作者在 T5-large 上搜出最佳 λ=0.15(即約 15% 的訓練範例來自生成視角)。
四、實驗設定
- 資料集:MS MARCO 段落排序(880 萬段落)。
- 驗證集 Dev:6,980 個查詢(調參與分析用);測試集 Dev-Rest:51,836 個查詢(驗證泛化)。
- 指標:MRR@10(對齊官方排行榜)。
- 兩段式管線:第一段用 BM25 粗撈候選 → 第二段用 T5 精排。
- 三種模型大小:T5-base(2.2 億參數)、T5-large(7.7 億)、T5-3B(28 億)。
- 每個設定用不同隨機種子微調 10 次,取最佳。
五、主結果:中模型追平大 3.6 倍的模型
單視角(只有 Rank)對比多視角(Rank + P2Q)的 MRR@10:
| 模型 | 參數量 | 單視角 Dev | 多視角 Dev | 單視角 Dev-Rest | 多視角 Dev-Rest |
|---|---|---|---|---|---|
| T5-base | 2.2 億 | 0.384 | 0.385 | 0.380 | 0.382 |
| T5-large | 7.7 億 | 0.395 | 0.401 | 0.390 | 0.393 |
| T5-3B | 28 億 | 0.398 | 0.402 | 0.395 | 0.396 |
(BM25 單獨的 MRR@10 只有 0.187,兩段式加上 T5 精排後大幅拉高,可見精排的重要。)
兩個重點:
- 多視角一致優於單視角:三種大小都有提升,其中 T5-large 進步最多(Dev +0.006)。
- 最關鍵的發現:多視角的 T5-large(0.401)追平了單視角的 T5-3B(0.398)——但 T5-large 只有 7.7 億參數,是 T5-3B(28 億)的不到三分之一。等於用「多一個視角」換到了「模型放大 3.6 倍」才有的效果。
對要控成本的人來說,這個結論很實在:與其硬上更大的模型(更貴、更慢),不如用多視角把中型模型的潛力榨出來。
六、成分分析:到底是哪個視角在幫忙?
作者做了一個很漂亮的對照,確認「贏」不是隨便加個第二任務就有的,而是特定的 P2Q 視角在起作用(λ 固定 0.15,MRR@10):
| 第二個視角 | MRR@10 |
|---|---|
| 無(只有 Rank,baseline) | 0.393 |
| 再加一個 Rank(同視角複製) | 0.391(沒幫助,甚至略降) |
| 加 P2Q(段落→查詢生成) | 0.399(最佳) |
| 加 Q2P(查詢→段落生成) | 0.394(幫助有限) |
結論很清楚:
- 把排序視角複製一份當第二視角 → 沒用(0.391)。所以不是「多一個任務」就好。
- 必須是互補的生成視角 P2Q(從段落反推查詢)→ 才有效(0.399)。
- 連方向都有講究:P2Q(段落→查詢)比 Q2P(查詢→段落)更有幫助。
這證明多視角的效果來自「視角要真的不同、要互補」,呼應了 ai-097 那句——多樣性要是真的多樣才有價值。
另外作者也觀察到:候選數 K 從 10 掃到 1000 時,多視角的優勢越來越大。也就是候選越多、雜訊越大的環境,多視角越能幫模型從雜訊中挑出相關段落。
七、這篇對「做 RAG 系統」的人有什麼用
把 ai-097 和這篇疊起來看,你的財報/ERP 問答檢索其實有兩段可以各自優化:
| 階段 | 對應論文 | 目標 | 可用技巧 |
|---|---|---|---|
| 第一段 粗撈 | ai-097 MMLF | 別漏(Recall 高) | 多查詢 + RRF 晚融合 |
| 第二段 精排 | 本篇 | 排得準(MRR 高) | T5 精排 + 多視角學習 |
兩個可帶走的實務觀念:
- 精排這一段值得投資:BM25 單獨 0.187,加上 T5 精排跳到 0.4 左右——第二段的品質對最終體驗影響巨大。
- 不一定要用更大的模型:多視角學習示範了「用訓練技巧換效能」的路。資源有限時,先想怎麼把中型模型榨乾,再考慮換大模型。
八、研究限制
以下為筆者閱讀後整理,部分原文明述、部分為個人判讀。
8.1 提升幅度偏小
多視角的絕對提升多在 0.001~0.006 之間。它的價值主要在「用小模型達到大模型效果」的效率面,而非把天花板大幅推高。
8.2 混合比例要調
最佳 λ=0.15 是在 T5-large 上搜出來的,T5-base 與 T5-3B 因算力限制直接沿用同一個 λ,未必各自最佳。換資料集或領域,λ 大概要重調。
8.3 只驗證英文段落排序
實驗只在 MS MARCO(英文)上。套到繁中財報/ERP 文件的精排,效果仍需自行驗證——這點和 ai-097 相同。
8.4 P2Q 視角依賴標註配對
生成視角需要「查詢—相關段落」配對來訓練。雖然不需要「額外」標註(用既有的相關配對即可),但完全沒有標註配對的場景就不適用。
九、總結
- 這篇做的是兩段式檢索的第二段:passage re-ranking(精排),與
ai-097(第一段粗撈)互補。 - 核心方法是多視角學習:在排序視角之外,additionally 加一個 P2Q(段落→查詢)的文字生成視角,兩者共享同一個 T5 表徵一起訓練。
- 用混合比例 λ 加權兩個損失,最佳 λ=0.15。
- 主結果:多視角一致優於單視角;最亮點是多視角 T5-large(0.401)追平單視角 T5-3B(0.398),參數量卻只有約三分之一。
- 成分分析證明:要用互補的 P2Q 視角才有效,複製排序視角或改用 Q2P 都不行——視角要真的不同才有價值。
- 代價:絕對提升不大、λ 要調、只驗證英文、生成視角需要既有標註配對。
一句話收束:
想讓模型更強,未必要餵更多資料或換更大的模型——有時只要教它「換個角度看同一件事」,中型模型就能追上大它三倍的對手。
參考資料
- Jia-Huei Ju, Jheng-Hong Yang, and Chuan-Ju Wang. Text-to-Text Multi-view Learning for Passage Re-ranking. SIGIR 2021.
- Colin Raffel et al. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer (T5). JMLR 2020.
- Rodrigo Nogueira et al. Document Ranking with a Pretrained Sequence-to-Sequence Model (monoT5). Findings of EMNLP 2020.
- Payal Bajaj et al. MS MARCO: A Human Generated MAchine Reading COmprehension Dataset. 2016.
免責聲明: 本文為論文閱讀與技術研究筆記。所述精排方法與實驗數據僅供技術研究參考,實際套用於不同語言或領域(如繁中財報、ERP 文件)的效果仍需自行驗證。