Paper 009 |整條研究線的起點:與其預測波動率數字,不如把公司「排出」風險高低

Paper 009 |整條研究線的起點:與其預測波動率數字,不如把公司「排出」風險高低

閱讀 COLING 2012 Demo 論文 Visualization on Financial Terms via Risk Ranking from Financial Reports。這是王釧茹老師財報風險研究線最早的一篇:在還沒引入金融情緒詞典(那是 2013 年的事)之前,它先做了一件更根本的事——把 Kogan 2009 的「回歸預測波動率」改成「學習排序(learning-to-rank)公司相對風險」,並用 Ranking SVM 顯著打敗 SVR。它也提供了一個雷達圖視覺化介面,把高風險與低風險的字攤開來看。理解這篇,才看得懂後面 ai-090/091/094 為什麼一路都在用排序。


前面幾篇(ai-091ai-094)反覆出現一個結論:「排序(ranking)比回歸(regression)穩定、合理。」但這個主張最早是從哪裡來的?

答案就是這篇 2012 年的 COLING Demo 論文。它是王釧茹老師這條財報風險研究線的起點——早於引入金融情緒詞典的 2013 年工作。在還沒開始篩選情緒詞之前,作者先處理了一個更根本的問題:

用財報文字預測「未來波動率是多少」這個精確數值,本來就很難。那我們是不是問錯問題了?

這篇的答案是:與其預測數值,不如排序——不要求模型算出某公司波動率是 0.15 還是 0.18,只要求它把「比較危險的公司」排在前面。

因為這是一篇 6 頁的 Demo 論文,資料量不大,但它奠定了後面整條線的方法基調。這篇筆記就講它做的三件事:把回歸改成排序、證明排序贏、以及一個視覺化介面。


參考資料與研究團隊

歷史小註:這篇的王老師標註單位是「臺北市立教育大學(Taipei Municipal University of Education)」,比 ai-091(2013)的「University of Taipei」還早——該校後來改制合併為臺北市立大學。從掛名單位就能看出這是整條線最早的一篇。

系列脈絡:本篇(2012 COLING Demo)是起點 → ai-091(2013 IJCNLP,引入情緒詞典)→ ai-094(2017 EJOR 期刊版)→ ai-090(2021 XRR,神經網路化)。整條線的「排序」基因,就是從這裡種下的。


一、問題轉向:從「預測數值」到「排出順序」

這篇的對手很明確,就是 Kogan 等人(2009)的經典做法:用 SVR(支援向量回歸)從財報文字直接預測公司未來的股價波動率數值。

作者質疑這個設定,理由有兩個:

  1. 財報文字裡雜訊很多,要從文字精準算出一個實數(波動率)本來就困難。
  2. 文字和「具體數值」之間的連結很弱——但文字和「相對高低」之間的連結相對可靠。

於是他們把問題重新定義成一個文字排序(text ranking)問題:

做法模型要輸出什麼難度來源
回歸(Kogan)精確的波動率數值文字雜訊大,硬要對到實數很難
排序(本篇)公司之間的相對風險順序只需判斷誰比誰危險,較穩健

這個「與其算數值、不如排順序」的直覺,就是後面 ai-091ai-094 一路沿用、並發現「排序模型學到的詞更穩定」的源頭。


二、方法:風險分級 + Ranking SVM

具體流程分兩步。

第一步:把波動率切成風險等級。 作者取每家公司股票報酬的波動率,取對數後(跨公司大致呈鐘形常態分布),依標準差切成 2ℓ+1 個等級。論文用 ℓ=2,切出 5 個風險等級(0 到 4):以平均值 m 為中心,用正負 1 個與 2 個標準差當切點。等級 4 代表最危險,等級 0 最安全。這裡的等級是「相對風險」——同一年公司彼此比較出來的。

第二步:用 Ranking SVM 學排序。 把每份財報表示成 TF-IDF 詞向量,用 Ranking SVM(Joachims, 2006)學習公司之間的相對順序:只要模型判斷公司 A 比公司 B 危險,就給 A 較高分數。相對地,baseline 是沿用 Kogan 的 SVR 回歸。

語料則與後續各篇一致:Kogan 的 10-K Corpus、只取 MD&A、1996–2006 年、Porter Stemming、前五年訓練測下一年。


三、結果:排序全面且顯著贏過回歸

Table 1 用 TF-IDF 特徵,比較 SVR(baseline)與 Ranking SVM。指標是 Kendall's Tau 與 Spearman's Rho,越高代表預測順序與真實風險順序越一致。

3.1 Kendall's Tau

測試年度SVR(baseline)Ranking SVM
20010.5170.539
20020.5360.549
20030.5310.543
20040.5150.526
20050.5150.539
20060.5140.525
平均0.5210.537

3.2 Spearman's Rho

測試年度SVR(baseline)Ranking SVM
20010.5490.571
20020.5670.580
20030.5620.575
20040.5450.556
20050.5440.568
20060.5400.551
平均0.5510.567

Ranking SVM 在六個年度、兩個指標上全部勝出,沒有一格輸。作者用 paired t-test 檢定,平均改善在 95% 信賴水準下統計顯著(Kendall p 值 6.57E-4、Spearman p 值 6.97E-4)。

作者還把訓練窗口從 5 年擴展到 T1–T5 共 30 組測試,結論一致(Spearman p 值 1.21E-4、Kendall p 值 7.27E-5)。

這張表就是整條研究線「排序 > 回歸」主張的第一份實證。


四、Demo 的主角:風險字視覺化

這是一篇 Demonstration 論文,所以視覺化才是它的招牌。作者把六個模型中權重最高的字挑出來(出現超過 2 次的,8 個正權重、8 個負權重),做成雷達圖。

  • 正權重(推向高風險):default(違約)、discontinu(停業/中止)、amend(契約修訂)、waiver(豁免)、coven(covenant,債務條款)、rais(raise,籌資)、lender(債權人)、nasdaq。
  • 負權重(推向低風險):dividend(股利)、pension(退休金)、swap、unsecur(無擔保)、properti(不動產)、repurchas(買回)、acquisit(併購)、mercer。

這組字很有金融直覺:一家公司若頻繁出現「違約、豁免、債務條款、籌資、債權人」,通常代表財務壓力(高風險);反之會發股利、談退休金、買回庫藏股、做併購的,多半是體質較穩的成熟公司(低風險)。

作者特別舉了 default 這個字——它是 Ranking 方法找到、但 Kogan 2009 沒報出的風險字。並回到原文佐證(AFC Enterprises 2005 年報提到 in the event of default 的或有負債)。

一個值得注意的細節:nasdaq(交易所名)也被列為高權重正向詞。這其實預告了後面 ai-091ai-094 的發現——用完整原文時,模型容易把交易所名、公司名這類「剛好與高風險公司共現」的雜訊詞學進來。這篇還沒引入情緒詞典來過濾,所以雜訊詞混進榜是可以預期的。


五、把這篇放進整條研究線

時間論文這一步做了什麼
2012本篇(COLING Demo)首倡「排序取代回歸」+ 風險字視覺化
2013ai-091(IJCNLP)加入金融情緒詞典,過濾雜訊(ORG vs SEN)
2017ai-094(EJOR)補上只用硬數據的基準線 BL,檢定顯著性
2021ai-090(XRR)換成階層式神經網路 + Attention 可解釋

看得出來,2012 這篇解決的是「用什麼問題設定」(排序),2013 之後解決的是「用什麼特徵」(情緒詞典)與「用什麼模型」(神經網路)。它像是整棟樓的地基——本身樸素,但少了它,後面幾層都立不起來。


六、研究限制

以下為筆者閱讀後整理,部分原文明述、部分為個人判讀。

6.1 這是 Demo 論文,規模小

只有一張結果表、TF-IDF 單一特徵,部分實驗因篇幅未列(作者註明可另索取)。它的貢獻在概念與介面,不在完整的實驗比較。

6.2 尚未過濾雜訊詞

還沒引入情緒詞典,所以 nasdaq 這類雜訊詞會混進高權重榜。這個問題要等 2013 年的 SEN 做法才處理。

6.3 Bag-of-Words 與波動率的老限制

TF-IDF 不理解語序;波動率用報酬標準差,不分漲跌。這些限制與系列其他篇相同。

6.4 排序不給絕對風險值

排序只告訴你「誰比誰危險」,不告訴你「有多危險」。實務上若需要絕對風險門檻,仍得搭配其他方法。


七、讀後啟發:先問對問題,再談模型

這篇最值得帶走的,不是某個模型或某張表,而是那個問題轉向:

當你發現「精準預測數值」怎麼調都做不好時,先退一步問——我是不是根本不需要精準數值,只需要相對順序?

很多 AI 任務都適用這個思路。與其硬要模型輸出一個難以校準的絕對分數,不如把它降級成排序或分級問題,往往更穩、更好用,也更容易解釋。這篇 2012 年的小論文,用一個財報風險的例子把這個道理講清楚了,也替後面近十年的研究定了調。


八、總結

  • 本篇是王釧茹老師財報風險研究線最早的一篇(COLING 2012 Demo),早於情緒詞典工作。
  • 核心貢獻是問題轉向:把 Kogan 2009 的「回歸預測波動率數值」改成「學習排序公司相對風險」。
  • 語料為 Kogan 的 10-K Corpus、MD&A、1996–2006;用 TF-IDF + Ranking SVM,5 個風險等級。
  • Ranking SVM 在六年、兩個指標上全面勝過 SVR baseline,95% 信賴水準顯著(Kendall 平均 0.537 對 0.521、Spearman 0.567 對 0.551)。
  • Demo 主角是風險字雷達圖:default/amend/waiver/covenant 等指向高風險,dividend/pension/acquisition 等指向低風險。
  • nasdaq 混入高權重榜,預告了「完整原文含雜訊詞」的問題,也為 2013 年引入情緒詞典埋下伏筆。

一句話收束:

這篇沒有華麗的模型,但它問對了問題——先把「預測數值」換成「排出順序」,後面整條研究線才走得通。


參考資料

  1. Ming-Feng Tsai and Chuan-Ju Wang. Visualization on Financial Terms via Risk Ranking from Financial Reports. COLING 2012 Demonstration Papers, 447–452.
  2. Shimon Kogan et al. Predicting Risk from Financial Reports with Regression. NAACL 2009.
  3. Thorsten Joachims. Training Linear SVMs in Linear Time. KDD 2006.
  4. Ming-Feng Tsai, Chuan-Ju Wang, Tse Liu, and Chin-Ting Chang. Financial Sentiment Analysis for Risk Prediction. IJCNLP 2013(本系列 ai-091).

免責聲明: 本文為論文閱讀與技術研究筆記,不構成任何投資建議。風險排序與波動率分析只能作為進一步研究線索,不能取代財務分析、風險管理與專業判斷。