All Posts

Marqeta (MQ) 股票分析紀錄
個股分析資訊科技

Marqeta (MQ) 股票分析紀錄

透過 SEC 10-K 與 DEF 14A 官方文件,深度拆解 Marqeta 的核心業務與高管薪酬結構。結合晨星五大護城河理論分析其壁壘,並透過財務指標與 DCF 模型評估其背後的投資價值。

Read more →
Paper 012 |不加標註、不換更大模型,只多一個「視角」:讓 T5-large 打平 3.6 倍大的 T5-3B
AI相關Paper-檢索

Paper 012 |不加標註、不換更大模型,只多一個「視角」:讓 T5-large 打平 3.6 倍大的 T5-3B

閱讀 SIGIR 2021 論文 Text-to-Text Multi-view Learning for Passage Re-ranking。如果說上一篇 ai-097(MMLF)管的是檢索的第一段「粗撈」,這篇管的就是第二段「精排(re-ranking)」。它的招數是多視角學習:在原本的「排序視角」之外,additionally 加一個「文字生成視角」(讓模型從段落反推出查詢),兩個目標共享同一個 T5 表徵一起訓練。結果是——不需要更多標註資料、也不用換更大的模型,就讓 T5-large 的精排效果追平參數量大 3.6 倍的 T5-3B。

Read more →
Paper 011 |別把生成的段落黏成一坨:MMLF 用「拆問題、各自查、再融合」改善 RAG 檢索
AI相關Paper-財務

Paper 011 |別把生成的段落黏成一坨:MMLF 用「拆問題、各自查、再融合」改善 RAG 檢索

閱讀 NAACL 2025 Findings 論文 MMLF: Multi-query Multi-passage Late Fusion Retrieval。這篇離開了前十篇的財報風險線,切進現代 LLM 驅動的檢索/RAG。核心主張很單純:用 LLM 把使用者問題拆成多個子問題、各自擴寫成假想文件、分別去檢索,最後用 Reciprocal Rank Fusion(RRF)把多份排名「晚融合」起來——而不是像 MILL 那樣把生成的段落全部黏成一坨文字再檢索。在 5 個 BEIR 資料集上,Recall@1k 平均提升 4%、最高 8%。三個消融實驗把每個設計選擇都驗證得很乾淨。

Read more →
Paper 010 |排序真的贏回歸嗎?一個被 ai-095 藏起來的但書:換成 TF 就打平了
AI相關Paper-財務

Paper 010 |排序真的贏回歸嗎?一個被 ai-095 藏起來的但書:換成 TF 就打平了

閱讀 ECIR 2013 論文 Risk Ranking from Financial Reports。它和上一篇 ai-095(COLING 2012)是同作者、同方法、同語料的雙胞胎——連 TF-IDF 結果表數字都完全相同。但這篇多做了一件事:把特徵從 TF-IDF 換成單純的 TF 再比一次,結果發現「排序顯著贏過回歸」這個結論,其實只在 TF-IDF 下成立;換成 TF,排序與回歸打平、且差異不顯著。這個但書讓「排序取代回歸」的主張變得更精確,也點出特徵設計的重要。

Read more →
Paper 009 |整條研究線的起點:與其預測波動率數字,不如把公司「排出」風險高低
AI相關Paper-財務

Paper 009 |整條研究線的起點:與其預測波動率數字,不如把公司「排出」風險高低

閱讀 COLING 2012 Demo 論文 Visualization on Financial Terms via Risk Ranking from Financial Reports。這是王釧茹老師財報風險研究線最早的一篇:在還沒引入金融情緒詞典(那是 2013 年的事)之前,它先做了一件更根本的事——把 Kogan 2009 的「回歸預測波動率」改成「學習排序(learning-to-rank)公司相對風險」,並用 Ranking SVM 顯著打敗 SVR。它也提供了一個雷達圖視覺化介面,把高風險與低風險的字攤開來看。理解這篇,才看得懂後面 ai-090/091/094 為什麼一路都在用排序。

Read more →
Paper 008 |文字真的贏過數字嗎?替 ai-091 補上一條「只用硬數據」的基準線
AI相關Paper-財務

Paper 008 |文字真的贏過數字嗎?替 ai-091 補上一條「只用硬數據」的基準線

閱讀 European Journal of Operational Research (EJOR) 2017 論文 On the Risk Prediction and Analysis of Soft Information in Finance Reports。這是 ai-091(IJCNLP 2013)的期刊完整版:同一套語料、同一套 ALL vs SEN 方法,但補上了 ai-091 最缺的一塊——一條「只用前 12 個月波動率、完全不看文字」的基準線 BL,並用 permutation test 檢定「軟資訊(文字)到底有沒有比硬數據多提供訊息」。結論誠實而微妙:在排序任務上,只用 1,546 個情緒詞就能顯著贏過硬數據基準;在回歸任務上則只是打平。

Read more →
Paper 007 |同一套方法,攤在四個任務前:18 年 40,708 份財報的關鍵字發掘
AI相關Paper-財務

Paper 007 |同一套方法,攤在四個任務前:18 年 40,708 份財報的關鍵字發掘

閱讀 ACM TMIS 2016 期刊論文 Discovering Finance Keywords via Continuous-Space Language Models。這是上一篇 ai-092(EMNLP 2014)的期刊完整版:語料從 11 年擴到 18 年(40,708 份 10-K、125,370 個詞),任務從 2 個擴到 4 個(post-event volatility、stock volatility、abnormal trading volume、excess return),並新增 LDA 擴充當對照組、t-SNE 詞向量視覺化,以及從資產/負債/權益三個會計視角拆解擴充出來的關鍵字。結論很誠實:在兩個波動率任務上擴充明顯有效且顯著,但在交易量與超額報酬上,純文字幾乎預測不動。

Read more →
Paper 006 |與其刪字,不如長字:用 word2vec 把 1,667 個金融情緒詞擴充成 13,534 個
AI相關Paper-財務

Paper 006 |與其刪字,不如長字:用 word2vec 把 1,667 個金融情緒詞擴充成 13,534 個

閱讀 EMNLP 2014 論文 Financial Keyword Expansion via Continuous Word Vector Representations。上一篇 ai-091 證明只留 1,546 個金融情緒詞就足夠,這篇則反過來問:既有詞典本身就不完整,能不能用 word2vec 自動補齊?研究以 CBOW 從 10-K 的 MD&A 學詞向量,把原始情緒詞典擴充成 9,282(EXP-SIM)與 13,534 個詞(EXP-SYN),並首次把 POS 詞性標記加進 CBOW 訓練。結果顯示擴充後的詞典在波動率回歸與風險排序上都穩定優於原始詞典與隨機擴充。

Read more →
Paper 005 |整份財報不一定比較好:用 1,546 個金融情緒詞預測企業風險
AI相關Paper-財務

Paper 005 |整份財報不一定比較好:用 1,546 個金融情緒詞預測企業風險

閱讀 IJCNLP 2013 論文 Financial Sentiment Analysis for Risk Prediction。研究將 Form 10-K 的 MD&A 從數萬個原始詞彙縮減為 1,546 個金融情緒詞,再以 SVR 與 Ranking SVM 預測未來 12 個月波動率及公司風險排序。結果顯示,金融情緒詞模型的平均表現與完整原文相當,並產生更一致且容易理解的風險詞彙。

Read more →