S SealHack

解題地圖

三個正交軸(模態×任務×機制)+ 五問路由 + 九條軌道。

本頁內容

你在這裡:支線 · 題型速查表(手冊只教了表格題;當你的比賽不是表格,先來這裡找到自己的軌道,再回六階段照走)

這頁在講什麼

先找到你是哪一種題,再決定怎麼打。 同一套六階段流程適用所有題型,但每種題的「切法、指標、起手模型、專屬地雷」不同——這頁就是那張對照表。

三個問題,直接跳到你的軌道

你的資料長什麼樣你要預測什麼你的軌道
表格(csv,一列一筆)是/否T1 表格·二分類
表格屬於哪一類(3 類以上)T2 表格·多分類
表格一個數字T3 表格·迴歸
有日期、要預測未來未來的數值T4 時間序列·預測
有日期哪裡不正常T5 時間序列·異常偵測
圖片 / 影片任何T6 影像
句子 / 文章任何T7 文字 NLP
聲音任何T8 音訊
要排出順序 / 推薦誰該排前面T9 排序·推薦

還不確定?往下讀五問路由;想知道為什麼要分三個軸(而不是只看資料型別),看下一節。


PART 1|題型分類的正確結構

三個正交的軸

大多數教材只講第一軸,這是新手迷路的主因。

軸 A|資料模態(決定「用什麼模型」)

模態資料長相2025 冠軍主流工具
表格 Tabular列 × 欄的數值/類別梯度提升樹(GBDT)(XGBoost / LightGBM / CatBoost)
時間序列 Time Series有時間順序的觀測GBDT + 特徵工程 / 序列 NN
影像 Vision圖片 / 影片 / 3DTransformer(ViT, Swin)已超越 CNN
文字 NLP句子 / 檔案生成式 LLM(Qwen 主導)
音訊 Audio波形 / 頻譜Whisper 微調 / CNN+SED
圖結構 Graph節點與邊GNN
互動環境 RL/Agent與環境互動自訂架構

軸 B|任務型別(決定「用什麼指標與損失」)

任務輸出常見指標
二分類一個機率曲線下面積(AUC) / LogLoss
多分類一組機率LogLoss / Accuracy / F1
多標籤多個獨立機率Macro-AUC / F1
迴歸一個數值均方根誤差(RMSE) / 平均絕對誤差(MAE)
多目標迴歸多個數值各目標加權
排序 / 推薦一個排序MAP@k / NDCG
偵測 / 分割位置或遮罩mAP / Dice / IoU
生成 / 序列文字或序列BLEU / WER / 自訂
存活分析時間 + 事件C-index

軸 C|比賽機制(決定「你的工作流長什麼樣」)⚠️ 最常被忽略

機制你交什麼影響
Prediction 競賽submission.csv你可以在本機/任何地方訓練,只要交檔案。流程自由
Code 競賽Notebook / 程式碼平臺跑你的模型,有時間與硬體上限,不能連網。必須處理推論效率
Simulation / Agent 競賽一個 agent與其他人對戰,沒有固定 test set
Analytics 競賽一份報告人工評審,沒有 leaderboard

Code 競賽現在是 Kaggle 主流。 它意味著「訓練可以在別處,但推論必須能在受限環境跑完」。 對新手最大的陷阱:辛苦訓練的巨大整合,提交時超時直接失敗。

「資料補全」不是題型

缺失值處理、資料清洗、異常值處理屬於前處理層,橫跨所有題型。 真正獨立的補全類問題(如感測器資料填補)其實是迴歸任務,只是目標是被挖掉的值。 評估方式特殊:人為挖洞 → 回填 → 比對。且最終該問的是「下游模型有沒有變好」。

2025 實證快照

  • 390+ 場比賽,30+ 平臺,總獎金超過 $16m;Kaggle 辦了 68 場
  • 表格:XGBoost / LightGBM 各 14 次冠軍,CatBoost 8 次
  • 影像:Transformer 首次超越 CNN
  • 文字:Qwen 系列幾乎壟斷
  • 音訊:5 場有人聲的比賽中 4 場冠軍微調 Whisper
  • AutoGluon 首次進入冠軍方案,以極低算力打敗人工精調整合
  • TabPFN 首次進入冠軍方案,用途是「產生特徵餵給 梯度提升樹(GBDT)」
  • 超過一半冠軍是單人;超過一半是首次奪冠
  • 多數冠軍訓練成本 < $100,不少是免費 notebook 零成本完成

PART 2|解題地圖(Solution Map)

總路由:五個問題定位你的軌道

Q1. 資料是什麼形態?        → 決定模態軌道
Q2. 要預測什麼?            → 決定任務類型
Q3. 官方用什麼指標?        → 決定損失函數與後處理
Q4. test 怎麼切的?         → 決定 CV 策略  ★最容易錯
Q5. 是 code 競賽嗎?        → 決定算力預算與推論限制

回答完這五題,你的技術方案就已經確定 80%。


軌道 T1|表格 · 二分類

辨識:一列一個樣本,要預測「會/不會」。信用違約、客戶流失、疾病預測。

專案建議
交叉驗證(CV)StratifiedKFold(5)。若有實體重複 → StratifiedGroupKFold
指標曲線下面積(AUC) → 不需校準;整合預設機率平均,尺度差異大才轉 rank
LogLoss → 需要校準,clip 極端值
起手模型LightGBM(objective='binary')
多樣化XGBoost / CatBoost / Logistic / MLP / TabPFN(≤5 萬列)
特徵重點群組聚合、frequency encoding、類別兩兩互動、target encoding(fold 內)
折外預測(OOF) 格式(n_train,) 一維
專屬陷阱類別不平衡時不要看 Accuracy;target encoding 洩漏
軌道 T2|表格 · 多分類 / 多標籤

辨識:預測屬於哪一類(多分類),或可同時屬於多類(多標籤)。

專案建議
交叉驗證(CV)StratifiedKFold。多標籤用 MultilabelStratifiedKFold
指標多分類 LogLoss;多標籤 Macro-AUC / Macro-F1
起手模型LightGBM multiclass / 多標籤用 OneVsRest
折外預測(OOF) 格式(n_train, n_class) 二維 ⚠️
專屬陷阱OOF 是矩陣,整合程式碼要另寫一套
類別數多時訓練時間暴漲,考慮分層策略
罕見類別的 fold 內可能一個樣本都沒有
軌道 T3|表格 · 迴歸

辨識:預測一個連續數值。房價、銷售額、物性預測。

專案建議
交叉驗證(CV)KFold。目標分布偏斜時 → 對 target 分箱做 StratifiedKFold
指標均方根誤差(RMSE) → 考慮 log1p(target),預測後 expm1 還原
平均絕對誤差(MAE) → objective 直接設 MAE,整合用中位數
起手模型LightGBM regression
特徵重點同 T1,另加數值間的比值/差值
折外預測(OOF) 格式(n_train,)
專屬陷阱target 變換後整合要在同一個尺度上做
離群值會主導 RMSE,先看目標分布
預測值超出合理範圍要 clip
軌道 T4|時間序列 · 預測

辨識:資料有時間順序,且 test 在 train 之後。銷售預測、需求預測、股價。

專案建議
交叉驗證(CV)絕對不能隨機切。 用擴張窗(expanding)或滑動窗(rolling)
驗證段必須完全在訓練段之後,且留 gap 對應預測視野
指標均方根誤差(RMSE) / 平均絕對誤差(MAE) / MAPE / SMAPE / Pinball(分位數)
起手模型LightGBM + 滯後特徵(視窗化成迴歸;M5 全前段皆此路,C12)
基線一定要有:naive(用上期值)、seasonal naive
特徵重點滯後(lag)、滾動統計(rolling mean/std)、指數加權、時間編碼(sin/cos)、節假日、事件旗標
折外預測(OOF) 格式(n_train,),但只有驗證段有值
專屬陷阱⚠️ 滾動特徵只能用過去資料,shift(1) 之後再 rolling
⚠️ 未來才知道的資訊(如當日總量)絕不可用
⚠️ 遞迴預測會累積誤差,考慮直接多步預測
分布漂移嚴重,近期資料權重要加高
⚠️ 邊界(C12):迴歸框架贏在「多序列共學+共變量」;單變量少序列時經典統計(ETS/ARIMA)反而強(M4 反例)
軌道 T5|時間序列 · 異常偵測

辨識:找出不正常的時段或事件。裝置故障、詐欺偵測。

專案建議
交叉驗證(CV)時間切分,且要保證每折都有正例
指標極度不平衡 → PR-AUC 優於 ROC-AUC
起手模型監督式有標籤 → 梯度提升樹(GBDT);無標籤 → Isolation Forest / 重建誤差
專屬陷阱正例可能只有 0.1%,取樣策略比模型重要
「異常」的定義常常模糊,先跟資料對齊
軌道 T6|影像

辨識:輸入是圖片、影片或 3D 體積。

專案建議
交叉驗證(CV)StratifiedKFold;同一病人/場景的多張圖必須 GroupKFold
起手模型分類/迴歸 → ViT(DinoV2)或 Swin(2025 已超越 CNN)
物件偵測 → YOLOv8 / YOLO11
分割 → U-Net 系 / SegFormer
醫療影像 → MONAI
核心工具timm(預訓練模型)、albumentations(增強)
勝負關鍵資料增強策略 > 模型選擇;TTA(測試時增強)幾乎必做
硬體需要 GPU。免費 Kaggle Notebook 的 T4/P100 仍能拿冠軍
專屬陷阱影像尺寸與 batch size 的取捨
預訓練權重的授權規定
Code 競賽的推論時間上限
軌道 T7|文字 NLP

辨識:輸入是文字。

專案建議
交叉驗證(CV)StratifiedKFold;同作者/同來源要 GroupKFold
起手模型2025 已轉向生成式 LLM:Qwen2.5 / Qwen3 系列
輕量需求仍可用 DeBERTa-v3
核心工具transformers, peft(LoRA 微調), unsloth(省記憶體), vllm(快速推論)
勝負關鍵微調策略(LoRA vs 全參數)、量化、推論最佳化
專屬陷阱Code 競賽的 12 小時上限 + 無網路,模型必須預先上傳
記憶體不足是常態,量化是必修課
軌道 T8|音訊

辨識:輸入是聲音。

專案建議
起手模型有人聲 → 微調 Whisper(2025 年 5 場中 4 場冠軍)
非人聲(如鳥鳴) → CNN + 聲音事件偵測頭
核心工具librosa, torchaudio, jiwer(語音評估)
常見做法轉成梅爾頻譜圖 → 當成影像問題處理
軌道 T9|排序 / 推薦

辨識:要給出一個排序,而非單一預測。

專案建議
交叉驗證(CV)按使用者 GroupKFold;有時間性則按時間切
指標MAP@k / NDCG / Recall@k
起手模型兩階段:召回(候選生成)→ 排序(LightGBM Ranker)
勝負關鍵候選生成的品質決定上限,排序模型只能在候選裡挑
專屬陷阱評估要模擬真實場景(冷啟動、時間順序)

跨軌道共通層

不管哪條軌道,以下永遠適用:

  1. Adversarial Validation 檢查 train/test 分布
  2. 折外預測(OOF) 落盤協議 — 每個實驗都存
  3. 實驗記錄表 — 記 交叉驗證(CV)、CV 標準差、排行榜(LB)
  4. 多樣化整合 — 模型差異性 > 單模型分數
  5. 提交選擇 — 一個 CV 最高 + 一個最穩健

找到你的軌道了?六階段主線照走,把該軌道的切法、指標、起手模型套進每一步。CV/OOF 這類核心詞不熟?查完整詞彙表——影像/NLP/音訊軌道的專有模型名(CNN、ViT 等)是各軌道自己的研究起點,本站不逐一收錄,是路標不是教材。