解題地圖
三個正交軸(模態×任務×機制)+ 五問路由 + 九條軌道。
你在這裡:支線 · 題型速查表(手冊只教了表格題;當你的比賽不是表格,先來這裡找到自己的軌道,再回六階段照走)
這頁在講什麼
先找到你是哪一種題,再決定怎麼打。 同一套六階段流程適用所有題型,但每種題的「切法、指標、起手模型、專屬地雷」不同——這頁就是那張對照表。
三個問題,直接跳到你的軌道
| 你的資料長什麼樣 | 你要預測什麼 | 你的軌道 |
|---|---|---|
| 表格(csv,一列一筆) | 是/否 | T1 表格·二分類 |
| 表格 | 屬於哪一類(3 類以上) | T2 表格·多分類 |
| 表格 | 一個數字 | T3 表格·迴歸 |
| 有日期、要預測未來 | 未來的數值 | T4 時間序列·預測 |
| 有日期 | 哪裡不正常 | T5 時間序列·異常偵測 |
| 圖片 / 影片 | 任何 | T6 影像 |
| 句子 / 文章 | 任何 | T7 文字 NLP |
| 聲音 | 任何 | T8 音訊 |
| 要排出順序 / 推薦 | 誰該排前面 | T9 排序·推薦 |
還不確定?往下讀五問路由;想知道為什麼要分三個軸(而不是只看資料型別),看下一節。
PART 1|題型分類的正確結構
三個正交的軸
大多數教材只講第一軸,這是新手迷路的主因。
軸 A|資料模態(決定「用什麼模型」)
| 模態 | 資料長相 | 2025 冠軍主流工具 |
|---|---|---|
| 表格 Tabular | 列 × 欄的數值/類別 | 梯度提升樹(GBDT)(XGBoost / LightGBM / CatBoost) |
| 時間序列 Time Series | 有時間順序的觀測 | GBDT + 特徵工程 / 序列 NN |
| 影像 Vision | 圖片 / 影片 / 3D | Transformer(ViT, Swin)已超越 CNN |
| 文字 NLP | 句子 / 檔案 | 生成式 LLM(Qwen 主導) |
| 音訊 Audio | 波形 / 頻譜 | Whisper 微調 / CNN+SED |
| 圖結構 Graph | 節點與邊 | GNN |
| 互動環境 RL/Agent | 與環境互動 | 自訂架構 |
軸 B|任務型別(決定「用什麼指標與損失」)
| 任務 | 輸出 | 常見指標 |
|---|---|---|
| 二分類 | 一個機率 | 曲線下面積(AUC) / LogLoss |
| 多分類 | 一組機率 | LogLoss / Accuracy / F1 |
| 多標籤 | 多個獨立機率 | Macro-AUC / F1 |
| 迴歸 | 一個數值 | 均方根誤差(RMSE) / 平均絕對誤差(MAE) |
| 多目標迴歸 | 多個數值 | 各目標加權 |
| 排序 / 推薦 | 一個排序 | MAP@k / NDCG |
| 偵測 / 分割 | 位置或遮罩 | mAP / Dice / IoU |
| 生成 / 序列 | 文字或序列 | BLEU / WER / 自訂 |
| 存活分析 | 時間 + 事件 | C-index |
軸 C|比賽機制(決定「你的工作流長什麼樣」)⚠️ 最常被忽略
| 機制 | 你交什麼 | 影響 |
|---|---|---|
| Prediction 競賽 | submission.csv | 你可以在本機/任何地方訓練,只要交檔案。流程自由 |
| Code 競賽 | Notebook / 程式碼 | 平臺跑你的模型,有時間與硬體上限,不能連網。必須處理推論效率 |
| Simulation / Agent 競賽 | 一個 agent | 與其他人對戰,沒有固定 test set |
| Analytics 競賽 | 一份報告 | 人工評審,沒有 leaderboard |
Code 競賽現在是 Kaggle 主流。 它意味著「訓練可以在別處,但推論必須能在受限環境跑完」。 對新手最大的陷阱:辛苦訓練的巨大整合,提交時超時直接失敗。
「資料補全」不是題型
缺失值處理、資料清洗、異常值處理屬於前處理層,橫跨所有題型。 真正獨立的補全類問題(如感測器資料填補)其實是迴歸任務,只是目標是被挖掉的值。 評估方式特殊:人為挖洞 → 回填 → 比對。且最終該問的是「下游模型有沒有變好」。
2025 實證快照
- 390+ 場比賽,30+ 平臺,總獎金超過 $16m;Kaggle 辦了 68 場
- 表格:XGBoost / LightGBM 各 14 次冠軍,CatBoost 8 次
- 影像:Transformer 首次超越 CNN
- 文字:Qwen 系列幾乎壟斷
- 音訊:5 場有人聲的比賽中 4 場冠軍微調 Whisper
- AutoGluon 首次進入冠軍方案,以極低算力打敗人工精調整合
- TabPFN 首次進入冠軍方案,用途是「產生特徵餵給 梯度提升樹(GBDT)」
- 超過一半冠軍是單人;超過一半是首次奪冠
- 多數冠軍訓練成本 < $100,不少是免費 notebook 零成本完成
PART 2|解題地圖(Solution Map)
總路由:五個問題定位你的軌道
Q1. 資料是什麼形態? → 決定模態軌道
Q2. 要預測什麼? → 決定任務類型
Q3. 官方用什麼指標? → 決定損失函數與後處理
Q4. test 怎麼切的? → 決定 CV 策略 ★最容易錯
Q5. 是 code 競賽嗎? → 決定算力預算與推論限制
回答完這五題,你的技術方案就已經確定 80%。
軌道 T1|表格 · 二分類
辨識:一列一個樣本,要預測「會/不會」。信用違約、客戶流失、疾病預測。
| 專案 | 建議 |
|---|---|
| 交叉驗證(CV) | StratifiedKFold(5)。若有實體重複 → StratifiedGroupKFold |
| 指標 | 曲線下面積(AUC) → 不需校準;整合預設機率平均,尺度差異大才轉 rank LogLoss → 需要校準,clip 極端值 |
| 起手模型 | LightGBM(objective='binary') |
| 多樣化 | XGBoost / CatBoost / Logistic / MLP / TabPFN(≤5 萬列) |
| 特徵重點 | 群組聚合、frequency encoding、類別兩兩互動、target encoding(fold 內) |
| 折外預測(OOF) 格式 | (n_train,) 一維 |
| 專屬陷阱 | 類別不平衡時不要看 Accuracy;target encoding 洩漏 |
軌道 T2|表格 · 多分類 / 多標籤
辨識:預測屬於哪一類(多分類),或可同時屬於多類(多標籤)。
| 專案 | 建議 |
|---|---|
| 交叉驗證(CV) | StratifiedKFold。多標籤用 MultilabelStratifiedKFold |
| 指標 | 多分類 LogLoss;多標籤 Macro-AUC / Macro-F1 |
| 起手模型 | LightGBM multiclass / 多標籤用 OneVsRest |
| 折外預測(OOF) 格式 | (n_train, n_class) 二維 ⚠️ |
| 專屬陷阱 | OOF 是矩陣,整合程式碼要另寫一套 類別數多時訓練時間暴漲,考慮分層策略 罕見類別的 fold 內可能一個樣本都沒有 |
軌道 T3|表格 · 迴歸
辨識:預測一個連續數值。房價、銷售額、物性預測。
| 專案 | 建議 |
|---|---|
| 交叉驗證(CV) | KFold。目標分布偏斜時 → 對 target 分箱做 StratifiedKFold |
| 指標 | 均方根誤差(RMSE) → 考慮 log1p(target),預測後 expm1 還原平均絕對誤差(MAE) → objective 直接設 MAE,整合用中位數 |
| 起手模型 | LightGBM regression |
| 特徵重點 | 同 T1,另加數值間的比值/差值 |
| 折外預測(OOF) 格式 | (n_train,) |
| 專屬陷阱 | target 變換後整合要在同一個尺度上做 離群值會主導 RMSE,先看目標分布 預測值超出合理範圍要 clip |
軌道 T4|時間序列 · 預測
辨識:資料有時間順序,且 test 在 train 之後。銷售預測、需求預測、股價。
| 專案 | 建議 |
|---|---|
| 交叉驗證(CV) | 絕對不能隨機切。 用擴張窗(expanding)或滑動窗(rolling) 驗證段必須完全在訓練段之後,且留 gap 對應預測視野 |
| 指標 | 均方根誤差(RMSE) / 平均絕對誤差(MAE) / MAPE / SMAPE / Pinball(分位數) |
| 起手模型 | LightGBM + 滯後特徵(視窗化成迴歸;M5 全前段皆此路,C12) 基線一定要有:naive(用上期值)、seasonal naive |
| 特徵重點 | 滯後(lag)、滾動統計(rolling mean/std)、指數加權、時間編碼(sin/cos)、節假日、事件旗標 |
| 折外預測(OOF) 格式 | (n_train,),但只有驗證段有值 |
| 專屬陷阱 | ⚠️ 滾動特徵只能用過去資料,shift(1) 之後再 rolling⚠️ 未來才知道的資訊(如當日總量)絕不可用 ⚠️ 遞迴預測會累積誤差,考慮直接多步預測 分布漂移嚴重,近期資料權重要加高 ⚠️ 邊界(C12):迴歸框架贏在「多序列共學+共變量」;單變量少序列時經典統計(ETS/ARIMA)反而強(M4 反例) |
軌道 T5|時間序列 · 異常偵測
辨識:找出不正常的時段或事件。裝置故障、詐欺偵測。
| 專案 | 建議 |
|---|---|
| 交叉驗證(CV) | 時間切分,且要保證每折都有正例 |
| 指標 | 極度不平衡 → PR-AUC 優於 ROC-AUC |
| 起手模型 | 監督式有標籤 → 梯度提升樹(GBDT);無標籤 → Isolation Forest / 重建誤差 |
| 專屬陷阱 | 正例可能只有 0.1%,取樣策略比模型重要 「異常」的定義常常模糊,先跟資料對齊 |
軌道 T6|影像
辨識:輸入是圖片、影片或 3D 體積。
| 專案 | 建議 |
|---|---|
| 交叉驗證(CV) | StratifiedKFold;同一病人/場景的多張圖必須 GroupKFold |
| 起手模型 | 分類/迴歸 → ViT(DinoV2)或 Swin(2025 已超越 CNN) 物件偵測 → YOLOv8 / YOLO11 分割 → U-Net 系 / SegFormer 醫療影像 → MONAI |
| 核心工具 | timm(預訓練模型)、albumentations(增強) |
| 勝負關鍵 | 資料增強策略 > 模型選擇;TTA(測試時增強)幾乎必做 |
| 硬體 | 需要 GPU。免費 Kaggle Notebook 的 T4/P100 仍能拿冠軍 |
| 專屬陷阱 | 影像尺寸與 batch size 的取捨 預訓練權重的授權規定 Code 競賽的推論時間上限 |
軌道 T7|文字 NLP
辨識:輸入是文字。
| 專案 | 建議 |
|---|---|
| 交叉驗證(CV) | StratifiedKFold;同作者/同來源要 GroupKFold |
| 起手模型 | 2025 已轉向生成式 LLM:Qwen2.5 / Qwen3 系列 輕量需求仍可用 DeBERTa-v3 |
| 核心工具 | transformers, peft(LoRA 微調), unsloth(省記憶體), vllm(快速推論) |
| 勝負關鍵 | 微調策略(LoRA vs 全參數)、量化、推論最佳化 |
| 專屬陷阱 | Code 競賽的 12 小時上限 + 無網路,模型必須預先上傳 記憶體不足是常態,量化是必修課 |
軌道 T8|音訊
辨識:輸入是聲音。
| 專案 | 建議 |
|---|---|
| 起手模型 | 有人聲 → 微調 Whisper(2025 年 5 場中 4 場冠軍) 非人聲(如鳥鳴) → CNN + 聲音事件偵測頭 |
| 核心工具 | librosa, torchaudio, jiwer(語音評估) |
| 常見做法 | 轉成梅爾頻譜圖 → 當成影像問題處理 |
軌道 T9|排序 / 推薦
辨識:要給出一個排序,而非單一預測。
| 專案 | 建議 |
|---|---|
| 交叉驗證(CV) | 按使用者 GroupKFold;有時間性則按時間切 |
| 指標 | MAP@k / NDCG / Recall@k |
| 起手模型 | 兩階段:召回(候選生成)→ 排序(LightGBM Ranker) |
| 勝負關鍵 | 候選生成的品質決定上限,排序模型只能在候選裡挑 |
| 專屬陷阱 | 評估要模擬真實場景(冷啟動、時間順序) |
跨軌道共通層
不管哪條軌道,以下永遠適用:
- Adversarial Validation 檢查 train/test 分布
- 折外預測(OOF) 落盤協議 — 每個實驗都存
- 實驗記錄表 — 記 交叉驗證(CV)、CV 標準差、排行榜(LB)
- 多樣化整合 — 模型差異性 > 單模型分數
- 提交選擇 — 一個 CV 最高 + 一個最穩健
找到你的軌道了?回六階段主線照走,把該軌道的切法、指標、起手模型套進每一步。CV/OOF 這類核心詞不熟?查完整詞彙表——影像/NLP/音訊軌道的專有模型名(CNN、ViT 等)是各軌道自己的研究起點,本站不逐一收錄,是路標不是教材。