
Paper 008 |文字真的贏過數字嗎?替 ai-091 補上一條「只用硬數據」的基準線
閱讀 European Journal of Operational Research (EJOR) 2017 論文 On the Risk Prediction and Analysis of Soft Information in Finance Reports。這是 ai-091(IJCNLP 2013)的期刊完整版:同一套語料、同一套 ALL vs SEN 方法,但補上了 ai-091 最缺的一塊——一條「只用前 12 個月波動率、完全不看文字」的基準線 BL,並用 permutation test 檢定「軟資訊(文字)到底有沒有比硬數據多提供訊息」。結論誠實而微妙:在排序任務上,只用 1,546 個情緒詞就能顯著贏過硬數據基準;在回歸任務上則只是打平。
WRITTEN BY

- Name
- Harry Chang
ai-091(IJCNLP 2013)留了一個沒完全回答的問題。那篇比較了「完整原文(ORG)」與「只用 1,546 個金融情緒詞(SEN)」,證明兩者表現相當。但它其實藏了一個前提:兩種模型都偷偷加了一個強力特徵——公司前 12 個月的波動率。
於是真正該問的問題是:
財報文字(軟資訊)到底有沒有比「公司過去的波動率」這種硬數據,多提供任何預測風險的資訊?
如果把文字全部拿掉、只留過去波動率,模型會差很多嗎?ai-091 沒有這條對照線。
同一批作者(Ming-Feng Tsai、Chuan-Ju Wang)在 2017 年的 European Journal of Operational Research(EJOR,一本作業研究/決策科學的期刊)期刊版,把這條線補上了。這篇 ai-094 就是 ai-091 的期刊完整版。
因為方法主體與 ai-091 幾乎相同,這篇筆記不重述方法,而聚焦期刊版新增的三件事:一條只用硬數據的基準線(BL)、一個顯著性檢定、以及更完整的詞權重分析。
- 參考資料與研究團隊
- 一、這篇跟 ai-091 是什麼關係
- 二、新增第一件事:一條「只用硬數據」的基準線 BL
- 三、新增第二件事:三種模型的正面對決
- 四、新增第三件事:permutation test 證明「文字真的有加分」
- 五、新增第四件事:更完整的詞權重分析
- 六、期刊版的定位:從 NLP 論文變成決策科學論文
- 七、把這篇的邏輯畫成一張圖
- 八、這篇相對 ai-091 多了什麼
- 九、研究限制
- 十、讀後啟發:先把基準線立起來
- 十一、總結
- 參考資料
參考資料與研究團隊
- 論文名稱:On the Risk Prediction and Analysis of Soft Information in Finance Reports(註1)
- 公開全文 PDF:EJOR2017-Chuan-Ju-Wang.pdf(NUS 開放存取版,即本文引用之來源)
- 出處:European Journal of Operational Research, 257 (2017) 243–250(2015/9 投稿、2016/6 接受、2016/7 上線)
- 主要研究人員:
- Ming-Feng Tsai(蔡明峰,政治大學)
- Chuan-Ju Wang(王釧茹,中央研究院)
補充:ScienceDirect 官方頁需付費。本文使用的是 NUS 的開放存取全文。
這條研究線的對稱結構:ai-091(IJCNLP 2013)= 本篇(EJOR 2017)的會議短論文版;ai-092(EMNLP 2014)= ai-093(TMIS 2016)的會議短論文版。兩條線都是「先發會議短版、再發期刊完整版」。
一、這篇跟 ai-091 是什麼關係
先把重疊的部分講清楚,讀過 ai-091 的人可以快速跳過:
- 語料相同:Kogan 等人的 10-K Corpus,1996–2006 年、30,465 份 MD&A。
- 詞典相同:Loughran–McDonald 六類情緒詞,3,911 個原始詞、Stemming 後去重得 1,546 個 unique 詞。
- 任務相同:回歸(SVR 預測未來 12 個月波動率)與排序(Ranking SVM 排公司相對風險)。
- 特徵相同:Bag-of-Words,回歸用 LOG1P、排序用 TFIDF。
- 時間切分相同:前五年訓練、測下一年(1996–2000 → 2001,滾動到 2006)。
如果這些對你是新的,建議先讀 ai-091。以下只談期刊版多做的事。
二、新增第一件事:一條「只用硬數據」的基準線 BL
這是期刊版最重要的補強。作者明確定義了三種模型:
| 模型 | 用到的資訊 | 回答的問題 |
|---|---|---|
| BL | 只用前 12 個月波動率(硬數據),完全不看文字 | 光靠過去波動率能預測多準? |
| ALL | 前 12 個月波動率 + 完整原文文字 | 加入全部文字有沒有幫助? |
| SEN | 前 12 個月波動率 + 只用 1,546 個金融情緒詞 | 加入精選情緒詞有沒有幫助? |
ai-091 只有 ALL(那裡叫 ORG)與 SEN 的比較,等於一直在比「哪種文字比較好」,卻沒問「文字本身值不值得加」。BL 這條線一補上,問題就變成真正有意義的版本:
在已知公司過去波動率的前提下,財報文字還能不能再擠出額外的預測力?
三、新增第二件事:三種模型的正面對決
以下三張表是論文的 Table 3。BL、ALL、SEN 三者比較,粗體為每列最佳。
3.1 回歸:預測未來 12 個月波動率(MSE,越低越好)
| 測試年度 | BL | ALL | SEN |
|---|---|---|---|
| 2001 | 0.17470 | 0.18082 | 0.18506 |
| 2002 | 0.16002 | 0.17175 | 0.16367 |
| 2003 | 0.18734 | 0.17157 | 0.15795 |
| 2004 | 0.14421 | 0.12879 | 0.12822 |
| 2005 | 0.13647 | 0.13038 | 0.13029 |
| 2006 | 0.14638 | 0.14287 | 0.13998 |
| 平均 | 0.15086 | 0.15436 | 0.15086 |
回歸任務的結論是誠實的「打平」:SEN 的平均 MSE(0.15086)與只用硬數據的 BL(0.15086)完全相同,而用完整文字的 ALL 反而略差。更有意思的是年度分布——2001、2002 年 BL 最佳,2003 年之後換 SEN 最佳。作者呼應 Kogan 等人的觀察:2002 年沙賓法案(Sarbanes–Oxley Act)之後,財報揭露變得更充實,文字的預測力才逐漸顯現。
3.2 排序:Kendall's Tau(越高越好)
| 測試年度 | BL | ALL | SEN |
|---|---|---|---|
| 2001 | 0.62455 | 0.62173 | 0.63349 |
| 2002 | 0.61973 | 0.63626 | 0.62280 |
| 2003 | 0.60755 | 0.58528 | 0.60527 |
| 2004 | 0.58616 | 0.59350 | 0.59017 |
| 2005 | 0.59990 | 0.59651 | 0.60273 |
| 2006 | 0.58248 | 0.57641 | 0.58287 |
| 平均 | 0.60339 | 0.60162 | 0.60622 |
3.3 排序:Spearman's Rho(越高越好)
| 測試年度 | BL | ALL | SEN |
|---|---|---|---|
| 2001 | 0.65486 | 0.65271 | 0.66397 |
| 2002 | 0.65001 | 0.66692 | 0.65303 |
| 2003 | 0.63874 | 0.61662 | 0.63646 |
| 2004 | 0.61548 | 0.62317 | 0.61953 |
| 2005 | 0.62857 | 0.62531 | 0.63133 |
| 2006 | 0.60942 | 0.60371 | 0.60999 |
| 平均 | 0.63284 | 0.63141 | 0.63572 |
排序任務的結論就漂亮多了:SEN 的兩個平均指標都是三者最高。也就是說,只用 1,546 個情緒詞,不但打贏用完整文字的 ALL,也贏過只用硬數據的 BL。
四、新增第三件事:permutation test 證明「文字真的有加分」
只看數字贏一點還不夠,得證明這個贏「不是運氣」。這是期刊版比 ai-091 嚴謹的地方——作者對排序結果做了 permutation test(置換檢定)。
檢定的白話意思:把標籤隨機打亂很多次,看看「SEN 贏 BL」這種差距,是不是隨機也常常出現。如果隨機幾乎做不出這種差距,就代表這個improvement是真的。
結果是:SEN 相對 BL 的排序改善達到統計顯著(p 小於 0.05)。這對應到論文的核心主張:
在已知硬數據(過去波動率)的前提下,金融情緒詞仍能提供額外且顯著的風險預測力。
把回歸與排序合起來看,這篇論文的立場其實很克制:文字不是萬能——在回歸上只是打平;但在「排出誰比較危險」這件事上,精選情緒詞確實比硬數據多講了一些東西。
五、新增第四件事:更完整的詞權重分析
ai-091 已經提過「排序模型學到的詞比回歸穩定」以及「完整原文會學到公司名稱」。期刊版把這塊做得更滿:它列出六個年度模型各自的 Top-10 加權詞(Table 4),再把六個模型的權重平均、排出總體最重要的詞。
六個排序模型平均後的 Top-5:
| 訓練資料 | 平均權重 Top-5 詞 |
|---|---|
| SEN(情緒詞) | amend、deficit、forbear、delist、default |
| ALL(完整原文) | ceg、nasdaq、gnb、coven、forbear |
兩組只有 forbear 重疊。差別一眼可見:
- SEN 學到的是可泛化的金融概念——契約修訂(amend)、虧損(deficit)、債務寬限(forbear)、下市(delist)、違約(default)。
- ALL 學到的是雜訊——ceg(Co-Energy Group 公司名)、gnb(GNB Technologies 公司名)、nasdaq(交易所名)。這些詞只是剛好和訓練資料裡某些高風險公司共現,換一批公司就失效。
作者也用一致性數字佐證排序比回歸穩定:amend、deficit、forbear 在六個排序模型中全部進榜;排序模型有 7 個詞出現超過 4 次,回歸只有 3 個;只出現一次的詞,排序有 11 個、回歸多達 20 個。
並回到原文舉例(與 ai-091 同一組案例):AGO 2006 年報的 amend 其實是「把借款利率從 LIBOR+2.00% 調降到+1.75%」——修訂不一定是壞事,暴露了 Bag-of-Words 只看字、不看語境的限制;AXS-One 2006 年報的 deficit(360 萬美元營運資金赤字)則與風險關係直接。
六、期刊版的定位:從 NLP 論文變成決策科學論文
值得注意的是發表場域。ai-091 發在 NLP 會議(IJCNLP),這篇發在 EJOR——一本作業研究與決策科學的期刊。這決定了它的框架更偏「怎麼用」:
- 明確點出應用場景:協助銀行改善信用風險評估(尤其質化評估)、讓基金經理人利用學到的高風險情緒詞設計策略。
- 強調可解釋性:文字模型比純數字模型更能「說出理由」——為什麼這家公司被判高風險,看得到是哪些字。
- 附上一套 web 視覺化與檢索系統(clip.csie.org/10K),把技術結果轉成可操作的介面,銜接學界與實務。
換句話說,同一份實驗,換到 OR 期刊,重點從「方法多準」轉向「這個訊號怎麼進到風險決策流程」。
七、把這篇的邏輯畫成一張圖
八、這篇相對 ai-091 多了什麼
| 面向 | ai-091(IJCNLP 2013) | 本篇(EJOR 2017) |
|---|---|---|
| 對照組 | ORG vs SEN | 新增 BL(只用硬數據)當基準線 |
| 核心問題 | 哪種文字比較好 | 文字比硬數據多提供訊息嗎 |
| 統計嚴謹度 | 只報數字 | permutation test 檢定顯著性 |
| 詞分析 | 簡述 | Table 4 六模型 Top-10 + 平均權重氣泡圖 |
| 風險等級 | 提及五級 | 形式化切分機制(依 log 波動率常態分布) |
| 框架 | NLP 方法 | OR 決策應用 + web 視覺化系統 |
期刊版的價值不在方法創新(方法就是 ai-091),而在補上那條缺失的基準線,並誠實回答一個更難的問題:文字在回歸上只打平、在排序上才顯著勝出。
九、研究限制
以下為筆者閱讀後整理,部分原文明述、部分為個人判讀。
9.1 回歸其實沒贏
SEN 在回歸的平均 MSE 只與 BL 打平。若把這篇讀成「文字全面勝過數字」,就過度解讀了。它真正證明的是「排序任務上,文字有顯著增量」。
9.2 仍是靜態 Bag-of-Words
amend 的案例(降息是好事卻被當高風險訊號)說明模型看不懂語境。這是 2016 年的方法限制,今天的 Contextual Embedding 已能改善。
9.3 高權重詞不等於因果
deficit 與高風險相關,不代表 deficit 這個字造成風險;它更可能只是既有財務困境在文字中的呈現。
9.4 資料年代與波動率定義
語料仍是 1996–2006;風險用報酬標準差,不分漲跌,把大漲也當高風險。
十、讀後啟發:先把基準線立起來
這篇最值得帶走的,不是又一次「情緒詞有效」,而是它示範了一個好習慣:
在宣稱「我的新訊號有用」之前,先立一條「完全不用這個訊號」的基準線。
ai-091 少了 BL,所以只能說「SEN 和 ORG 差不多」;ai-094 補上 BL,才能精確地說「文字在排序上比純數字多貢獻了顯著的一塊,在回歸上則沒有」。做 AI 系統時也一樣——想證明 RAG、想證明加了某個文字特徵有用,得先有一條只用既有結構化數據的基準線,否則「變好」可能只是錯覺。
三個可帶走的觀念:
- 立基準線:沒有 BL,任何「文字有用」的宣稱都站不穩。
- 分任務看:同一份文字,在排序上有效、在回歸上打平——別用單一結論概括。
- 顯著性檢定:贏一點點要用 permutation test 確認不是運氣。
十一、總結
- 本篇是
ai-091(IJCNLP 2013)的 EJOR 2017 期刊完整版,語料、詞典、任務與ai-091相同。 - 最大補強是新增 BL 基準線(只用前 12 個月波動率、不看文字),把問題升級為「文字比硬數據多提供訊息嗎」。
- 回歸任務:SEN 平均 MSE 0.15086,與 BL 打平,ALL 略差;2002 年沙賓法案後文字預測力才顯現。
- 排序任務:SEN 的 Kendall's Tau(0.60622)與 Spearman's Rho(0.63572)皆為三者最高,且相對 BL 的改善經 permutation test 檢定顯著(p 小於 0.05)。
- 詞權重分析:SEN 學到 amend、deficit、forbear、delist、default 等可泛化概念;ALL 則被 ceg、gnb、nasdaq 等公司名/交易所名污染。
- 期刊版偏 OR 決策框架,強調信用風險、可解釋性,並附 web 視覺化系統。
一句話收束:
ai-091 問「哪種文字比較好」,ai-094 問「文字到底值不值得用」——差別就在那條被補上的基準線。
參考資料
- Ming-Feng Tsai and Chuan-Ju Wang. On the Risk Prediction and Analysis of Soft Information in Finance Reports. European Journal of Operational Research, 257(1), 243–250, 2017.
- Ming-Feng Tsai, Chuan-Ju Wang, Tse Liu, and Chin-Ting Chang. Financial Sentiment Analysis for Risk Prediction. IJCNLP 2013(本系列
ai-091). - Tim Loughran and Bill McDonald. When Is a Liability Not a Liability? Textual Analysis, Dictionaries, and 10-Ks. The Journal of Finance, 2011.
- Shimon Kogan et al. Predicting Risk from Financial Reports with Regression. NAACL 2009.
免責聲明: 本文為論文閱讀與技術研究筆記,不構成任何投資建議。情緒詞、波動率預測與風險排序只能作為進一步研究線索,不能取代財務分析、風險管理與專業判斷。