
Paper 010 |排序真的贏回歸嗎?一個被 ai-095 藏起來的但書:換成 TF 就打平了
閱讀 ECIR 2013 論文 Risk Ranking from Financial Reports。它和上一篇 ai-095(COLING 2012)是同作者、同方法、同語料的雙胞胎——連 TF-IDF 結果表數字都完全相同。但這篇多做了一件事:把特徵從 TF-IDF 換成單純的 TF 再比一次,結果發現「排序顯著贏過回歸」這個結論,其實只在 TF-IDF 下成立;換成 TF,排序與回歸打平、且差異不顯著。這個但書讓「排序取代回歸」的主張變得更精確,也點出特徵設計的重要。
WRITTEN BY

- Name
- Harry Chang
上一篇 ai-095(COLING 2012)得出一個漂亮的結論:把風險預測從「回歸」改成「排序」,Ranking SVM 全面且顯著贏過 SVR。
但那篇只用了一種特徵:TF-IDF。於是有個問題沒被回答:
「排序贏回歸」這件事,是換成任何特徵都成立的普遍現象,還是剛好在 TF-IDF 下才發生?
同一批作者(Ming-Feng Tsai、Chuan-Ju Wang)在 ECIR 2013 的這篇短論文,補上了這個檢驗。它和 ai-095 幾乎是雙胞胎——同樣的 Ranking SVM vs SVR、同樣的 10-K 語料、同樣的五級風險切分,連 TF-IDF 的結果表數字都一字不差。差別只在兩點:它多跑了一組 TF 特徵,並把整件事放進「資訊檢索」的框架來談。
因為方法與 ai-095 重疊極高,這篇筆記只講它真正新增的部分。讀過 ai-095 的人,重點看第三節就好。
- 參考資料與研究團隊
- 一、先講清楚:這篇跟 ai-095 重疊多少
- 二、新增框架:把「風險排序」正式當成資訊檢索問題
- 三、新增檢驗:換成 TF,排序就不贏了
- 四、順帶的觀察:default 與 debt 常同時出現
- 五、這篇相對 ai-095 多了什麼
- 六、研究限制
- 七、讀後啟發:方法的勝負,常常藏在特徵裡
- 八、總結
- 參考資料
參考資料與研究團隊
- 論文名稱:Risk Ranking from Financial Reports(註1)
- 公開全文 PDF:ecir2013_tsai.pdf(作者個人頁,即本文引用之來源)
- 出處:ECIR 2013, LNCS 7814, pp. 804–807(Springer)
- 主要研究人員:
- Ming-Feng Tsai(蔡明峰,政治大學)
- Chuan-Ju Wang(王釧茹,臺北市立教育大學)
系列脈絡(同一年連發三篇的排序線):ai-095(2012 COLING Demo,主打視覺化)→ 本篇(2013 ECIR,主打 IR 框架與 TF 檢驗)→ ai-091(2013 IJCNLP,引入情緒詞典)。前兩篇是雙胞胎,第三篇才換了新武器。
一、先講清楚:這篇跟 ai-095 重疊多少
幾乎全部。以下都相同:
- 方法:Ranking SVM(排序)對比 SVR(回歸 baseline)。
- 語料:Kogan 的 10-K Corpus,只取 MD&A,1996–2006。
- 風險切分:取對數波動率、依標準差切成 5 級(ℓ=2、u=1)。
- 時間切分:前五年訓練測下一年。
- TF-IDF 的結果:Ranking SVM 平均 Kendall 0.537、Spearman 0.567,顯著贏過 SVR——這組數字與
ai-095完全相同。
如果這些對你是新的,請先讀 ai-095。以下只談兩個新增點。
二、新增框架:把「風險排序」正式當成資訊檢索問題
這篇發表在 ECIR(European Conference on Information Retrieval,歐洲資訊檢索會議),所以它的敘事重心不在視覺化(那是 COLING 版的賣點),而在把問題歸類成一個資訊檢索(IR)任務。
這個框架其實很自然。學習排序(learning-to-rank)本來就是從網頁搜尋長出來的技術:
| 場景 | 給定 | 要排序的對象 | 依據 |
|---|---|---|---|
| 網頁搜尋(IR 本行) | 一個查詢 query | 一堆網頁文件 | 與查詢的相關性 |
| 本篇(借過來用) | 一年份財報 | 一堆公司 | 相對風險高低 |
作者的洞見是:「把公司依風險排序」和「把網頁依相關性排序」,在數學結構上是同一種問題。既然 IR 界已經有成熟的 learning-to-rank 工具(Ranking SVM),那就直接借過來解財務風險。這也是為什麼這篇會落在 IR 的會議,而不是 NLP 或財務的會議。
三、新增檢驗:換成 TF,排序就不贏了
這才是這篇真正有價值的新結果。作者除了 TF-IDF,還多跑了一組**單純的 TF(詞頻)**特徵,兩相對照:
| 特徵 | 指標 | SVR(回歸) | Ranking SVM(排序) | 是否顯著 |
|---|---|---|---|---|
| TF | Kendall's Tau | 0.505 | 0.505 | 否(打平,p 值 0.460) |
| TF | Spearman's Rho | 0.535 | 0.535 | 否(打平,p 值 0.474) |
| TF-IDF | Kendall's Tau | 0.521 | 0.537 | 是(p 值 6.57E-4) |
| TF-IDF | Spearman's Rho | 0.551 | 0.567 | 是(p 值 6.97E-4) |
(表為六年平均;p 值來自 paired t-test,星號代表 95% 信賴水準下顯著。)
結論一翻兩瞪眼:
- 用 TF 時,排序與回歸平手,而且差異不顯著——作者自己也直說「兩種方法基本相當」。
- 用 TF-IDF 時,排序才顯著勝出。
所以 ai-095 那句「排序取代回歸」要加一個但書:
排序之所以贏,不是單靠「換成排序」,而是要搭配 TF-IDF 這種好的特徵權重才成立。
為什麼差在 TF-IDF?兩者的差別在於 IDF(逆文件頻率)這一項:
- TF:只算某個詞在這篇財報出現幾次。像 company、year、financial 這種每份財報都狂出現的詞,會拿到很高的分數,把訊號淹掉。
- TF-IDF:在 TF 之上再乘一個 IDF——某個詞如果「幾乎每份財報都有」,IDF 就把它壓低;只有那些「少數財報才出現」的詞(往往才是關鍵風險詞)權重才會被凸顯。
換句話說,TF-IDF 先幫模型把常見雜訊詞降權、把稀有訊號詞升權。排序模型在這種乾淨的特徵上,才能發揮它的優勢;餵它滿是雜訊的 TF,它就和回歸沒兩樣了。
這個但書其實預告了半年後 ai-091 的方向——既然「壓低雜訊詞」這麼關鍵,那乾脆直接用金融情緒詞典把雜訊詞整批砍掉(SEN)。TF-IDF 是自動降權,情緒詞典是人工硬砍,動機是同一個。
四、順帶的觀察:default 與 debt 常同時出現
這篇也用學到的模型看了詞的關係,但角度和 ai-095 的雷達圖不同:它注意的是詞的共現(co-occurrence)。
作者觀察到:在資料裡 default(違約)常和 debt(債務)一起出現,而這組搭配通常對應高風險等級。金融上很直覺——公司「違約」正是因為無法履行「債務」契約的義務。這種「成對出現的詞更能指向風險」的觀察,後來在 ai-090(XRR)用 Attention 機制被更完整地建模。
五、這篇相對 ai-095 多了什麼
| 面向 | ai-095(COLING 2012 Demo) | 本篇(ECIR 2013) |
|---|---|---|
| 賣點 | 風險字視覺化雷達圖 | IR 框架 + 特徵檢驗 |
| 特徵 | 只有 TF-IDF | 新增 TF 對照 |
| 關鍵新結論 | 排序顯著贏回歸 | 排序只在 TF-IDF 下贏,TF 打平 |
| 詞分析 | 正負權重雷達圖 | default–debt 共現 |
| 場域 | NLP(計算語言學) | IR(資訊檢索) |
一句話:ai-095 說「排序贏了」,ai-096 補上「但要用對特徵才贏」。
六、研究限制
以下為筆者閱讀後整理,部分原文明述、部分為個人判讀。
6.1 與 ai-095 高度重疊
這是一篇 4 頁短論文,核心實驗與 ai-095 相同。它的獨立貢獻集中在 TF 對照與 IR 框架,不是一份全新的研究。
6.2 尚未過濾雜訊詞
和 ai-095 一樣,還沒引入情緒詞典。TF-IDF 只是「自動降權」雜訊,並沒有真正把它們移除;徹底處理要等 ai-091 的 SEN。
6.3 Bag-of-Words 的老限制
TF 與 TF-IDF 都不理解語序;default 與 debt 的共現只是統計相關,不代表因果。
七、讀後啟發:方法的勝負,常常藏在特徵裡
這篇最值得帶走的一課,不是「排序比較好」,而是那個被補上的但書:
同一個模型(排序),換一種特徵(TF vs TF-IDF),結論可以從「顯著贏」變成「打平」。
做 AI 系統時很容易把功勞歸給「我換了更好的方法」,但很多時候真正起作用的是特徵工程——這裡就是 IDF 那一步降權的效果。如果 ai-095 只報 TF-IDF、不報 TF,讀者會以為排序無條件勝出;ECIR 這篇多跑一組 TF,才讓結論變得精確而誠實。
三個可帶走的觀念:
- 一個好結論,值得換個特徵再驗一次,看它是不是穩健。
- TF-IDF 的 IDF 項=自動幫常見詞降權,這一步往往比換模型更關鍵。
- 想證明「新方法有效」,最好連同「在什麼條件下才有效」一起講清楚。
八、總結
- 本篇(ECIR 2013)與
ai-095(COLING 2012)是雙胞胎:同作者、同方法、同語料,TF-IDF 結果完全相同。 - 新增框架:把「依風險排序公司」正式歸類為資訊檢索(learning-to-rank)問題,借用網頁搜尋的排序技術。
- 新增檢驗:多跑 TF 特徵。結果顯示排序只在 TF-IDF 下顯著贏回歸(Kendall 0.537 對 0.521、Spearman 0.567 對 0.551);換成 TF 則與回歸打平、不顯著。
- 關鍵一課:排序的勝出要靠 TF-IDF 的降權效果;這也預告了
ai-091用情緒詞典硬砍雜訊詞的動機。 - 順帶觀察 default 與 debt 的共現指向高風險,後由
ai-090(XRR)以 Attention 完整建模。
一句話收束:
ai-095 證明了「排序會贏」,ai-096 誠實地補上「贏,是有條件的」——而那個條件,藏在 TF-IDF 的一個小小 IDF 項裡。
參考資料
- Ming-Feng Tsai and Chuan-Ju Wang. Risk Ranking from Financial Reports. ECIR 2013, LNCS 7814, pp. 804–807.
- Ming-Feng Tsai and Chuan-Ju Wang. Visualization on Financial Terms via Risk Ranking from Financial Reports. COLING 2012 Demonstration Papers(本系列
ai-095). - Shimon Kogan et al. Predicting Risk from Financial Reports with Regression. NAACL 2009.
- Thorsten Joachims. Training Linear SVMs in Linear Time. KDD 2006.
免責聲明: 本文為論文閱讀與技術研究筆記,不構成任何投資建議。風險排序與波動率分析只能作為進一步研究線索,不能取代財務分析、風險管理與專業判斷。