
Paper 001 |不是摘要財報,而是找出「今年跟去年哪裡變了」:A Compare-and-contrast Multistage Pipeline for Uncovering Financial Signals in Financial Reports
閱讀論文 A Compare-and-contrast Multistage Pipeline for Uncovering Financial Signals in Financial Reports。這篇研究不直接摘要單一年度財報,而是比較同一家公司連續兩年的 10-K,透過片段配對、關係辨識、偽標籤與軟標籤,標示真正代表年度變化的財務訊號。
WRITTEN BY

- Name
- Harry Chang
財務報告最大的問題,往往不是資訊太少,而是真正重要的新資訊,被大量與去年相同的文字包在裡面。
一家公司每年提交的 10-K,會重複說明公司業務、會計政策、風險、營運狀況與管理階層分析。對分析人員而言,真正想知道的其實不是整份報告說了什麼,而是:
今年和去年相比,究竟改了什麼?
這篇論文 A Compare-and-contrast Multistage Pipeline for Uncovering Financial Signals in Financial Reports (ACL 2023),沒有沿用傳統的財報摘要思路,而是利用財報天然具有的年度延續性,把去年的報告當成 reference、今年的報告當成 target,找出兩者之間真正具有資訊價值的文字變化。
這篇論文的特點在於,它不只建立了一個金融 NLP 模型,更重新定義了問題:
金融訊號不一定是整份報告中最重要的句子,而可能只是與去年相比,被修改的幾個詞。
參考資料與研究團隊
- 論文連結:ACL 頁面 (A Compare-and-contrast Multistage Pipeline for Uncovering Financial Signals in Financial Reports)
- 主要研究人員:
- Jia-Huei Ju
- Yu-Shiang Huang
- Cheng-Wei Lin
- Che Lin
- Chuan-Ju Wang (王釧茹,中央研究院資訊創新研究中心)
一、這篇論文想解決什麼問題?
1.1 財報不是沒有訊號,而是重複資訊太多
美國 SEC 要求上市公司在 10-K 中完整揭露公司的財務與營運狀況,因此文件通常很長,也包含大量例行性、法規性與已知資訊。
同一家公司的相鄰年度財報,往往高度重疊。論文統計 2011 至 2018 年、3,849 家公司的 10-K Item 7,相鄰年度的平均 token overlap 約為:
[ 0.826 ]
也就是說,平均約有八成以上的內容具有文字重疊。
這會造成一個實務問題:
分析人員必須閱讀大量熟悉內容,才能找到少量真正改變的資訊。
傳統摘要模型會找出「最能代表整篇文件」的內容,但財務分析人員真正關心的,未必是最具代表性的句子,而是今年新增、刪除或反轉的資訊。
例如:
2017 年:
Net sales in the Americas increased 5%, or $201.8 million.
2018 年:
Net sales in the Americas decreased 1%, or $58.5 million.
兩句話的結構幾乎完全相同,但真正重要的訊號只有:
- increased → decreased
- 5% → 1%
- 58.5 million
如果只做一般摘要,這種少量但關鍵的變化不一定會被保留下來。
因此,這篇論文的核心主張是:
不要只閱讀今年的財報,而是把去年當成比較基準。
二、研究方法全景:先配對,再分類,最後標字
論文提出了一個「比對與對照 (Compare-and-contrast)」的多階段流水線 (Multistage Pipeline),整體流程可以分成三個階段:
| 階段 | 任務 | 核心目的 | 應用技術 |
|---|---|---|---|
| 文件切分與對齊 | 把冗長的財報切成小片段,並找出前後兩年對應的段落 | spaCy, Cross-Segment BERT | |
| 關係辨識 | 判斷這兩段是「一模一樣」、「略有修改」還是「完全不同」 | ROUGE-2, Sentence-BERT | |
| / | 財務訊號標示 | 針對「略有修改」的段落,精準挑出改變的關鍵字 | 偽標籤 (Pseudo-labeling), 軟標籤, KL divergence |
簡化後的運作邏輯如下:
三、三個階段深度拆解
階段一 ():找對象 (Alignment)
財報很長,直接把兩萬字丟進模型比對是不現實的。因此第一步是利用 NLP 工具 (spaCy) 將財報切成句子或語意片段,接著透過模型算出去年片段與今年片段的相似度,幫它們「配對」。
階段二 ():關係分類 (Relation Identification)
配對完之後,這些句子對 (Sentence Pairs) 會有三種命運:
- Same (相同):幾乎沒改,可以直接忽略,因為沒有新資訊。
- Unmatched (不匹配):完全找不到對應,可能是今年全新開展的業務,整段都需要看。
- Revised (修訂):有高度重疊但部分被修改。這通常是分析師尋找「財務訊號」的主要來源。
階段三 ():訊號標示 (Signal Uncovering)
針對那些被歸類為 Revised (修訂) 的句子,模型要在 Word-level (單詞層級) 上標示出哪些字是真正重要的財務訊號。
這一步是論文的核心技術:由於「哪些字是訊號」的訓練資料相對缺乏,作者使用了偽標籤 (Pseudo-labeling) 技術。他們利用比對去年與今年句子的差異 (例如用差異比對演算法找出被改掉的字),將這些字標記為 1 (是訊號),沒改的標記為 0 (非訊號),藉此訓練出一個能夠自動抓取重點財務訊號的序列標註模型。進階版 () 則引入了 KL divergence 與軟標籤來提升學習效果。
四、這與 LLM 摘要有什麼不同?
現在大語言模型 (LLM) 如此發達,為什麼還需要這樣的 Pipeline?
- 抗幻覺與高解釋性:LLM 有時會為了讓摘要通順而「腦補」因果關係。這個 Pipeline 直接在原句上高亮顯示 (Highlight) 改變的文字,沒有幻覺空間,完全忠於財報。
- 專注於「變數」而非「常數」:如果請 LLM 總結財報,LLM 可能會將「這是一家賣蘋果電腦的公司」等已知資訊納入摘要。這個架構讓系統專注於「Delta (變化量)」,更貼近實際的金融分析需求。
- 長文本處理成本:將兩份超長 10-K 全部塞進 LLM Token 視窗雖然現在可行,但成本極高且容易發生 Attention Lost。先做段落對齊與篩選,再處理重點,效率大幅提升。
五、讀後啟發:AI 金融分析的典範轉移
這篇論文指出了「比較基準 (Baseline)」設定的重要性。
許多人在做金融 AI 時,總是想著「我要如何把這份文件濃縮」。但實務上的投資決策,往往是基於「預期差」或「邊際變化」:
- 營收增長了,但增幅比去年小?
- 風險揭露欄位裡,突然多出了一段關於「供應鏈地緣政治」的描述?
- 壞帳提列的比例,原本是 2%,今年悄悄被改成了 3.5%?
這篇研究具體展現了細節至上的投資哲學。把兩份文件放在一起,刪除相同的常數,留下的變數,往往是推動股價波動的關鍵訊號。這條由中央研究院王釧茹老師團隊開發的研究路徑,除了是自然語言處理在金融領域的實際應用案例外,也是設計 Agentic Workflow (智能體工作流) 時可參考的核心邏輯。