Paper 008 |文字真的贏過數字嗎?替 ai-091 補上一條「只用硬數據」的基準線

Paper 008 |文字真的贏過數字嗎?替 ai-091 補上一條「只用硬數據」的基準線

閱讀 European Journal of Operational Research (EJOR) 2017 論文 On the Risk Prediction and Analysis of Soft Information in Finance Reports。這是 ai-091(IJCNLP 2013)的期刊完整版:同一套語料、同一套 ALL vs SEN 方法,但補上了 ai-091 最缺的一塊——一條「只用前 12 個月波動率、完全不看文字」的基準線 BL,並用 permutation test 檢定「軟資訊(文字)到底有沒有比硬數據多提供訊息」。結論誠實而微妙:在排序任務上,只用 1,546 個情緒詞就能顯著贏過硬數據基準;在回歸任務上則只是打平。


ai-091(IJCNLP 2013)留了一個沒完全回答的問題。那篇比較了「完整原文(ORG)」與「只用 1,546 個金融情緒詞(SEN)」,證明兩者表現相當。但它其實藏了一個前提:兩種模型都偷偷加了一個強力特徵——公司前 12 個月的波動率。

於是真正該問的問題是:

財報文字(軟資訊)到底有沒有比「公司過去的波動率」這種硬數據,多提供任何預測風險的資訊?

如果把文字全部拿掉、只留過去波動率,模型會差很多嗎?ai-091 沒有這條對照線。

同一批作者(Ming-Feng Tsai、Chuan-Ju Wang)在 2017 年的 European Journal of Operational Research(EJOR,一本作業研究/決策科學的期刊)期刊版,把這條線補上了。這篇 ai-094 就是 ai-091 的期刊完整版。

因為方法主體與 ai-091 幾乎相同,這篇筆記不重述方法,而聚焦期刊版新增的三件事:一條只用硬數據的基準線(BL)、一個顯著性檢定、以及更完整的詞權重分析。


參考資料與研究團隊

補充:ScienceDirect 官方頁需付費。本文使用的是 NUS 的開放存取全文。

這條研究線的對稱結構:ai-091(IJCNLP 2013)= 本篇(EJOR 2017)的會議短論文版;ai-092(EMNLP 2014)= ai-093(TMIS 2016)的會議短論文版。兩條線都是「先發會議短版、再發期刊完整版」。


一、這篇跟 ai-091 是什麼關係

先把重疊的部分講清楚,讀過 ai-091 的人可以快速跳過:

  • 語料相同:Kogan 等人的 10-K Corpus,1996–2006 年、30,465 份 MD&A。
  • 詞典相同:Loughran–McDonald 六類情緒詞,3,911 個原始詞、Stemming 後去重得 1,546 個 unique 詞。
  • 任務相同:回歸(SVR 預測未來 12 個月波動率)與排序(Ranking SVM 排公司相對風險)。
  • 特徵相同:Bag-of-Words,回歸用 LOG1P、排序用 TFIDF。
  • 時間切分相同:前五年訓練、測下一年(1996–2000 → 2001,滾動到 2006)。

如果這些對你是新的,建議先讀 ai-091。以下只談期刊版多做的事。


二、新增第一件事:一條「只用硬數據」的基準線 BL

這是期刊版最重要的補強。作者明確定義了三種模型:

模型用到的資訊回答的問題
BL只用前 12 個月波動率(硬數據),完全不看文字光靠過去波動率能預測多準?
ALL前 12 個月波動率 + 完整原文文字加入全部文字有沒有幫助?
SEN前 12 個月波動率 + 只用 1,546 個金融情緒詞加入精選情緒詞有沒有幫助?

ai-091 只有 ALL(那裡叫 ORG)與 SEN 的比較,等於一直在比「哪種文字比較好」,卻沒問「文字本身值不值得加」。BL 這條線一補上,問題就變成真正有意義的版本:

在已知公司過去波動率的前提下,財報文字還能不能再擠出額外的預測力?


三、新增第二件事:三種模型的正面對決

以下三張表是論文的 Table 3。BL、ALL、SEN 三者比較,粗體為每列最佳。

3.1 回歸:預測未來 12 個月波動率(MSE,越低越好)

測試年度BLALLSEN
20010.174700.180820.18506
20020.160020.171750.16367
20030.187340.171570.15795
20040.144210.128790.12822
20050.136470.130380.13029
20060.146380.142870.13998
平均0.150860.154360.15086

回歸任務的結論是誠實的「打平」:SEN 的平均 MSE(0.15086)與只用硬數據的 BL(0.15086)完全相同,而用完整文字的 ALL 反而略差。更有意思的是年度分布——2001、2002 年 BL 最佳,2003 年之後換 SEN 最佳。作者呼應 Kogan 等人的觀察:2002 年沙賓法案(Sarbanes–Oxley Act)之後,財報揭露變得更充實,文字的預測力才逐漸顯現。

3.2 排序:Kendall's Tau(越高越好)

測試年度BLALLSEN
20010.624550.621730.63349
20020.619730.636260.62280
20030.607550.585280.60527
20040.586160.593500.59017
20050.599900.596510.60273
20060.582480.576410.58287
平均0.603390.601620.60622

3.3 排序:Spearman's Rho(越高越好)

測試年度BLALLSEN
20010.654860.652710.66397
20020.650010.666920.65303
20030.638740.616620.63646
20040.615480.623170.61953
20050.628570.625310.63133
20060.609420.603710.60999
平均0.632840.631410.63572

排序任務的結論就漂亮多了:SEN 的兩個平均指標都是三者最高。也就是說,只用 1,546 個情緒詞,不但打贏用完整文字的 ALL,也贏過只用硬數據的 BL。


四、新增第三件事:permutation test 證明「文字真的有加分」

只看數字贏一點還不夠,得證明這個贏「不是運氣」。這是期刊版比 ai-091 嚴謹的地方——作者對排序結果做了 permutation test(置換檢定)。

檢定的白話意思:把標籤隨機打亂很多次,看看「SEN 贏 BL」這種差距,是不是隨機也常常出現。如果隨機幾乎做不出這種差距,就代表這個improvement是真的。

結果是:SEN 相對 BL 的排序改善達到統計顯著(p 小於 0.05)。這對應到論文的核心主張:

在已知硬數據(過去波動率)的前提下,金融情緒詞仍能提供額外且顯著的風險預測力。

把回歸與排序合起來看,這篇論文的立場其實很克制:文字不是萬能——在回歸上只是打平;但在「排出誰比較危險」這件事上,精選情緒詞確實比硬數據多講了一些東西。


五、新增第四件事:更完整的詞權重分析

ai-091 已經提過「排序模型學到的詞比回歸穩定」以及「完整原文會學到公司名稱」。期刊版把這塊做得更滿:它列出六個年度模型各自的 Top-10 加權詞(Table 4),再把六個模型的權重平均、排出總體最重要的詞。

六個排序模型平均後的 Top-5:

訓練資料平均權重 Top-5 詞
SEN(情緒詞)amend、deficit、forbear、delist、default
ALL(完整原文)ceg、nasdaq、gnb、coven、forbear

兩組只有 forbear 重疊。差別一眼可見:

  • SEN 學到的是可泛化的金融概念——契約修訂(amend)、虧損(deficit)、債務寬限(forbear)、下市(delist)、違約(default)。
  • ALL 學到的是雜訊——ceg(Co-Energy Group 公司名)、gnb(GNB Technologies 公司名)、nasdaq(交易所名)。這些詞只是剛好和訓練資料裡某些高風險公司共現,換一批公司就失效。

作者也用一致性數字佐證排序比回歸穩定:amend、deficit、forbear 在六個排序模型中全部進榜;排序模型有 7 個詞出現超過 4 次,回歸只有 3 個;只出現一次的詞,排序有 11 個、回歸多達 20 個。

並回到原文舉例(與 ai-091 同一組案例):AGO 2006 年報的 amend 其實是「把借款利率從 LIBOR+2.00% 調降到+1.75%」——修訂不一定是壞事,暴露了 Bag-of-Words 只看字、不看語境的限制;AXS-One 2006 年報的 deficit(360 萬美元營運資金赤字)則與風險關係直接。


六、期刊版的定位:從 NLP 論文變成決策科學論文

值得注意的是發表場域。ai-091 發在 NLP 會議(IJCNLP),這篇發在 EJOR——一本作業研究與決策科學的期刊。這決定了它的框架更偏「怎麼用」:

  • 明確點出應用場景:協助銀行改善信用風險評估(尤其質化評估)、讓基金經理人利用學到的高風險情緒詞設計策略。
  • 強調可解釋性:文字模型比純數字模型更能「說出理由」——為什麼這家公司被判高風險,看得到是哪些字。
  • 附上一套 web 視覺化與檢索系統(clip.csie.org/10K),把技術結果轉成可操作的介面,銜接學界與實務。

換句話說,同一份實驗,換到 OR 期刊,重點從「方法多準」轉向「這個訊號怎麼進到風險決策流程」。


七、把這篇的邏輯畫成一張圖

Loading Diagram...

八、這篇相對 ai-091 多了什麼

面向ai-091(IJCNLP 2013)本篇(EJOR 2017)
對照組ORG vs SEN新增 BL(只用硬數據)當基準線
核心問題哪種文字比較好文字比硬數據多提供訊息嗎
統計嚴謹度只報數字permutation test 檢定顯著性
詞分析簡述Table 4 六模型 Top-10 + 平均權重氣泡圖
風險等級提及五級形式化切分機制(依 log 波動率常態分布)
框架NLP 方法OR 決策應用 + web 視覺化系統

期刊版的價值不在方法創新(方法就是 ai-091),而在補上那條缺失的基準線,並誠實回答一個更難的問題:文字在回歸上只打平、在排序上才顯著勝出。


九、研究限制

以下為筆者閱讀後整理,部分原文明述、部分為個人判讀。

9.1 回歸其實沒贏

SEN 在回歸的平均 MSE 只與 BL 打平。若把這篇讀成「文字全面勝過數字」,就過度解讀了。它真正證明的是「排序任務上,文字有顯著增量」。

9.2 仍是靜態 Bag-of-Words

amend 的案例(降息是好事卻被當高風險訊號)說明模型看不懂語境。這是 2016 年的方法限制,今天的 Contextual Embedding 已能改善。

9.3 高權重詞不等於因果

deficit 與高風險相關,不代表 deficit 這個字造成風險;它更可能只是既有財務困境在文字中的呈現。

9.4 資料年代與波動率定義

語料仍是 1996–2006;風險用報酬標準差,不分漲跌,把大漲也當高風險。


十、讀後啟發:先把基準線立起來

這篇最值得帶走的,不是又一次「情緒詞有效」,而是它示範了一個好習慣:

在宣稱「我的新訊號有用」之前,先立一條「完全不用這個訊號」的基準線。

ai-091 少了 BL,所以只能說「SEN 和 ORG 差不多」;ai-094 補上 BL,才能精確地說「文字在排序上比純數字多貢獻了顯著的一塊,在回歸上則沒有」。做 AI 系統時也一樣——想證明 RAG、想證明加了某個文字特徵有用,得先有一條只用既有結構化數據的基準線,否則「變好」可能只是錯覺。

三個可帶走的觀念:

  1. 立基準線:沒有 BL,任何「文字有用」的宣稱都站不穩。
  2. 分任務看:同一份文字,在排序上有效、在回歸上打平——別用單一結論概括。
  3. 顯著性檢定:贏一點點要用 permutation test 確認不是運氣。

十一、總結

  • 本篇是 ai-091(IJCNLP 2013)的 EJOR 2017 期刊完整版,語料、詞典、任務與 ai-091 相同。
  • 最大補強是新增 BL 基準線(只用前 12 個月波動率、不看文字),把問題升級為「文字比硬數據多提供訊息嗎」。
  • 回歸任務:SEN 平均 MSE 0.15086,與 BL 打平,ALL 略差;2002 年沙賓法案後文字預測力才顯現。
  • 排序任務:SEN 的 Kendall's Tau(0.60622)與 Spearman's Rho(0.63572)皆為三者最高,且相對 BL 的改善經 permutation test 檢定顯著(p 小於 0.05)。
  • 詞權重分析:SEN 學到 amend、deficit、forbear、delist、default 等可泛化概念;ALL 則被 ceg、gnb、nasdaq 等公司名/交易所名污染。
  • 期刊版偏 OR 決策框架,強調信用風險、可解釋性,並附 web 視覺化系統。

一句話收束:

ai-091 問「哪種文字比較好」,ai-094 問「文字到底值不值得用」——差別就在那條被補上的基準線。


參考資料

  1. Ming-Feng Tsai and Chuan-Ju Wang. On the Risk Prediction and Analysis of Soft Information in Finance Reports. European Journal of Operational Research, 257(1), 243–250, 2017.
  2. Ming-Feng Tsai, Chuan-Ju Wang, Tse Liu, and Chin-Ting Chang. Financial Sentiment Analysis for Risk Prediction. IJCNLP 2013(本系列 ai-091).
  3. Tim Loughran and Bill McDonald. When Is a Liability Not a Liability? Textual Analysis, Dictionaries, and 10-Ks. The Journal of Finance, 2011.
  4. Shimon Kogan et al. Predicting Risk from Financial Reports with Regression. NAACL 2009.

免責聲明: 本文為論文閱讀與技術研究筆記,不構成任何投資建議。情緒詞、波動率預測與風險排序只能作為進一步研究線索,不能取代財務分析、風險管理與專業判斷。