Paper 001 |不是摘要財報,而是找出「今年跟去年哪裡變了」:A Compare-and-contrast Multistage Pipeline for Uncovering Financial Signals in Financial Reports

Paper 001 |不是摘要財報,而是找出「今年跟去年哪裡變了」:A Compare-and-contrast Multistage Pipeline for Uncovering Financial Signals in Financial Reports

閱讀論文 A Compare-and-contrast Multistage Pipeline for Uncovering Financial Signals in Financial Reports。這篇研究不直接摘要單一年度財報,而是比較同一家公司連續兩年的 10-K,透過片段配對、關係辨識、偽標籤與軟標籤,標示真正代表年度變化的財務訊號。


財務報告最大的問題,往往不是資訊太少,而是真正重要的新資訊,被大量與去年相同的文字包在裡面。

一家公司每年提交的 10-K,會重複說明公司業務、會計政策、風險、營運狀況與管理階層分析。對分析人員而言,真正想知道的其實不是整份報告說了什麼,而是:

今年和去年相比,究竟改了什麼?

這篇論文 A Compare-and-contrast Multistage Pipeline for Uncovering Financial Signals in Financial Reports (ACL 2023),沒有沿用傳統的財報摘要思路,而是利用財報天然具有的年度延續性,把去年的報告當成 reference、今年的報告當成 target,找出兩者之間真正具有資訊價值的文字變化。

這篇論文的特點在於,它不只建立了一個金融 NLP 模型,更重新定義了問題:

金融訊號不一定是整份報告中最重要的句子,而可能只是與去年相比,被修改的幾個詞。


參考資料與研究團隊


一、這篇論文想解決什麼問題?

1.1 財報不是沒有訊號,而是重複資訊太多

美國 SEC 要求上市公司在 10-K 中完整揭露公司的財務與營運狀況,因此文件通常很長,也包含大量例行性、法規性與已知資訊。

同一家公司的相鄰年度財報,往往高度重疊。論文統計 2011 至 2018 年、3,849 家公司的 10-K Item 7,相鄰年度的平均 token overlap 約為:

[ 0.826 ]

也就是說,平均約有八成以上的內容具有文字重疊。

這會造成一個實務問題:

分析人員必須閱讀大量熟悉內容,才能找到少量真正改變的資訊。

傳統摘要模型會找出「最能代表整篇文件」的內容,但財務分析人員真正關心的,未必是最具代表性的句子,而是今年新增、刪除或反轉的資訊。

例如:

2017 年:

Net sales in the Americas increased 5%, or $201.8 million.

2018 年:

Net sales in the Americas decreased 1%, or $58.5 million.

兩句話的結構幾乎完全相同,但真正重要的訊號只有:

  • increased → decreased
  • 5% → 1%
  • 201.8million201.8 million → 58.5 million

如果只做一般摘要,這種少量但關鍵的變化不一定會被保留下來。

因此,這篇論文的核心主張是:

不要只閱讀今年的財報,而是把去年當成比較基準。


二、研究方法全景:先配對,再分類,最後標字

論文提出了一個「比對與對照 (Compare-and-contrast)」的多階段流水線 (Multistage Pipeline),整體流程可以分成三個階段:

階段任務核心目的應用技術
S0S_0文件切分與對齊把冗長的財報切成小片段,並找出前後兩年對應的段落spaCy, Cross-Segment BERT
S1S_1關係辨識判斷這兩段是「一模一樣」、「略有修改」還是「完全不同」ROUGE-2, Sentence-BERT
S2S_2 / S2+S_2^+財務訊號標示針對「略有修改」的段落,精準挑出改變的關鍵字偽標籤 (Pseudo-labeling), 軟標籤, KL divergence

簡化後的運作邏輯如下:

Loading Diagram...

三、三個階段深度拆解

階段一 (S0S_0):找對象 (Alignment)

財報很長,直接把兩萬字丟進模型比對是不現實的。因此第一步是利用 NLP 工具 (spaCy) 將財報切成句子或語意片段,接著透過模型算出去年片段與今年片段的相似度,幫它們「配對」。

階段二 (S1S_1):關係分類 (Relation Identification)

配對完之後,這些句子對 (Sentence Pairs) 會有三種命運:

  1. Same (相同):幾乎沒改,可以直接忽略,因為沒有新資訊。
  2. Unmatched (不匹配):完全找不到對應,可能是今年全新開展的業務,整段都需要看。
  3. Revised (修訂):有高度重疊但部分被修改。這通常是分析師尋找「財務訊號」的主要來源。

階段三 (S2S_2):訊號標示 (Signal Uncovering)

針對那些被歸類為 Revised (修訂) 的句子,模型要在 Word-level (單詞層級) 上標示出哪些字是真正重要的財務訊號。

這一步是論文的核心技術:由於「哪些字是訊號」的訓練資料相對缺乏,作者使用了偽標籤 (Pseudo-labeling) 技術。他們利用比對去年與今年句子的差異 (例如用差異比對演算法找出被改掉的字),將這些字標記為 1 (是訊號),沒改的標記為 0 (非訊號),藉此訓練出一個能夠自動抓取重點財務訊號的序列標註模型。進階版 (S2+S_2^+) 則引入了 KL divergence 與軟標籤來提升學習效果。


四、這與 LLM 摘要有什麼不同?

現在大語言模型 (LLM) 如此發達,為什麼還需要這樣的 Pipeline?

  1. 抗幻覺與高解釋性:LLM 有時會為了讓摘要通順而「腦補」因果關係。這個 Pipeline 直接在原句上高亮顯示 (Highlight) 改變的文字,沒有幻覺空間,完全忠於財報。
  2. 專注於「變數」而非「常數」:如果請 LLM 總結財報,LLM 可能會將「這是一家賣蘋果電腦的公司」等已知資訊納入摘要。這個架構讓系統專注於「Delta (變化量)」,更貼近實際的金融分析需求。
  3. 長文本處理成本:將兩份超長 10-K 全部塞進 LLM Token 視窗雖然現在可行,但成本極高且容易發生 Attention Lost。先做段落對齊與篩選,再處理重點,效率大幅提升。

五、讀後啟發:AI 金融分析的典範轉移

這篇論文指出了「比較基準 (Baseline)」設定的重要性。

許多人在做金融 AI 時,總是想著「我要如何把這份文件濃縮」。但實務上的投資決策,往往是基於「預期差」或「邊際變化」:

  • 營收增長了,但增幅比去年小?
  • 風險揭露欄位裡,突然多出了一段關於「供應鏈地緣政治」的描述?
  • 壞帳提列的比例,原本是 2%,今年悄悄被改成了 3.5%?

這篇研究具體展現了細節至上的投資哲學。把兩份文件放在一起,刪除相同的常數,留下的變數,往往是推動股價波動的關鍵訊號。這條由中央研究院王釧茹老師團隊開發的研究路徑,除了是自然語言處理在金融領域的實際應用案例外,也是設計 Agentic Workflow (智能體工作流) 時可參考的核心邏輯。