機器學習

存活分析:Kaplan-Meier 與 Cox 回歸 - 職災風險窗口與設備失效時間
一般模型問「會不會出事」,存活分析問「多久內會出事」。本篇介紹醫學統計的鎮山之寶——Kaplan-Meier 曲線與 Cox 比例風險模型,用 600 名新進作業員的首次工傷資料,找出職災風險窗口、量化速成訓練的代價,並揭露一個天真統計會踩死的陷阱:刪失資料。

時間序列預測:ARIMA 與 Prophet - 每月工傷件數趨勢
工傷件數有淡旺季嗎?安全改善計畫真的有效嗎?本篇用十年月度工傷資料實測兩大時序模型:統計學派的 SARIMA 與 Meta 開源的 Prophet。實驗跑出一個殘酷的劇情:預設參數的 Prophet 輸給「直接抄去年同月」的天真基準——以及如何用元件圖診斷、調參逆轉的完整過程。

不平衡資料處理:SMOTE 與 Focal Loss - 職災稀有事件預測
職災預測最大的敵人不是模型不夠強,而是資料天生不平衡:97% 準確率的模型可能漏掉四分之三的事故。本篇介紹兩大對策——資料層的 SMOTE 合成採樣與損失函數層的 Focal Loss,並用實驗揭露一個反直覺的真相:它們改變的往往不是模型的能力,而是決策的立場。

非監督學習:異常偵測三劍客 (Isolation Forest / One-Class SVM / LOF) - 廠區異常操作行為偵測
職災通常不是天降橫禍,而是「異常操作」累積的結果。本篇介紹異常偵測三大經典演算法:Isolation Forest 的隨機切分哲學、One-Class SVM 的正常邊界學派、LOF 的局部密度比較法,並以射出成型機的操作行為資料實戰演練。

監督學習:支持向量機 (SVM) - 乳癌檢測
在深度學習爆紅之前,曾經統治了機器學習界長達 20 年的分類器。本篇深入探討 SVM 的核心哲學:最大化邊際 (Margin),以及處理非線性問題的神奇魔法——核函數 (Kernel Trick)。

監督學習:決策樹的智慧——資訊增益與吉尼不純度
決策樹是如何決定每一次的「分叉」?本篇延續分類大師班的結構,透過經典的鳶尾花資料集,深入解析決策樹的核心分裂指標:資訊增益(Information Gain)與吉尼不純度(Gini Impurity)。

非監督學習-推薦系統實戰-以MovieLens 100k為例
為什麼 Netflix 比你還了解你的電影品味?本篇揭開推薦系統神祕的面紗,學習如何利用 SVD (奇異值分解) 將巨大的評分矩陣進行分解,從而挖掘出隱藏的「電影基因」,實現精準的個人化推薦。

非監督學習-PCA 降維-以乳腺癌診斷數據為例
面對 30 個維度的數據,人類的視覺已經失靈。本篇透過乳腺癌資料集,展示如何利用 PCA (主成分分析) 進行數據瘦身,將高維度的訊息「壓縮」成 2 維的可視化地圖,並學會讀懂這張地圖背後的變異真相。

非監督學習-關聯規則-以尿布與啤酒為例
為什麼尿布和啤酒會被擺在一起?這不是巧合,而是數據的旨意。本篇深入解析關聯規則的三大支柱:支持度、置信度與提升度,帶你從購籃數據中挖掘出反直覺的商業金礦。