快速版:最短完賽路
每階段只做一件核心的事,約 3–4 週能獨立完成一場表格賽。想深入再點進完整版。
本頁內容
定位:⚡ 進階七步(同一條路、每步多一層理由)| ⏱ 約 15 分 · 前置:做過一次🐣 手冊最好
想要每個階段的完整深度?看0 診斷 起的六個階段頁。
解題方法有兩個深度,先挑一個:
- 快速版(這頁) —— 每階段只留一件必要動作。目標是先完成一場比賽,不追求刷榜。約 3–4 週,對應下方學習地圖的路徑 A。
- 完整版 —— 左側「照順序學」裡 0 診斷 起的各階段頁,每階段的完整深度(消融、防過擬合、代理實驗…)。刷牌、精通時再用。
新手先走快速版;每一步卡住或想深入,點該階段的連結進完整版。
最短完賽路(七步)
| 階段 | 只做這一件事 | 為什麼 |
|---|---|---|
| 0 診斷 | 做五問路由:模態→任務→指標→test 怎麼切→code 賽?先定交叉驗證(CV)切法。 | 這步錯(例:時間序列用隨機切),後面全錯,而且 AI 不會告訴你 |
| 0.5 清洗 | 樹模型(LightGBM)別填補——它原生處理 NaN;只加一欄 is_missing。見清洗 | 填補會抹掉「缺失本身的訊號」;過度清洗是白工 |
| 1 鎖 CV | 24 小時內跑通「讀檔 → 最簡特徵 → LightGBM → 提交」,折外預測(OOF)落盤。見鎖死驗證 | 有一次成功提交前,不要碰特徵工程;OOF 是後面一切的原料 |
| 2 基線 | 先跑一次 AutoGluon 當錨點 + 一個 LightGBM;資料 ≤5 萬列一定試 TabPFN。見多樣化基線 | 錨點告訴你「不做人工特徵能到哪」,贏不過它代表方向錯 |
| 3 特徵 | 一次加一組,在同一組折上算配對差、t>2 才留;群組聚合 + 差值/比值最有效。見特徵迭代 | 一次加十組=不知道哪組有用;配對比較才看得見小樣本的訊號 |
| 4 集成 | 小樣本(n≲3000)直接跳過,用單模 + 多 seed 平均;資料夠大才爬山。見集成 | 小樣本湊不出實力相近的成員,爬山只會過擬合 OOF |
| 5 提交 | 選 2 份:CV 最高 + 最穩健;交之前檢查行數 / NaN / 欄名 / ID 順序。見收尾與提交 | 絕不兩份都挑 public 排行榜(LB)最高;格式錯直接 0 分 |
什麼時候升級到完整版
- 交叉驗證(CV)與排行榜(LB)方向脫鉤 → 回五問重查切法,並看 LB 教條。
- 分數卡住、想再擠一點 → 完整版的消融驅動選題、集成防過擬合三招。
- 小樣本題(n≲3000)→ 直接看小樣本作戰守則,那是換一套決策統計。
不管哪個版本,鐵律不變:先學會診斷,再讓 AI 動手;每個決定都用可重跑的驗證撐著,不要照抄別人的方案。
學習地圖:先修什麼、走哪條路(展開)
先修什麼、走哪條路——這不是線性課程,是有向圖:
3.0 依賴關係(不是線性課程,是有向圖)
┌─────────────────────────┐
L0 前置 │ Python 基礎 / pandas │
└───────────┬─────────────┘
↓
┌─────────────────────────┐
L1 心智核心 │ 過擬合 → 交叉驗證 → OOF │ ★ 全部題型共用
│ 指標 / 泄漏 / 基線 │
└───────────┬─────────────┘
↓
┌─────────────────────────┐
L2 表格骨幹 │ 決策樹 → GBDT │ ★ 投報率最高
│ 特徵工程 / 特徵重要性 │
└───────────┬─────────────┘
↓
┌───────────────────────┼───────────────────────┐
↓ ↓ ↓
┌─────────┐ ┌──────────────┐ ┌──────────────┐
│ L3 集成 │ │ L3 時間序列 │ │ L3 深度學習 │
│ 爬山/堆疊│ │ 時間切分/滯後│ │ PyTorch 基礎 │
└─────────┘ └──────────────┘ └──────┬───────┘
↓
┌───────────┴──────────┐
↓ ↓
┌──────────┐ ┌──────────┐
│ L4 影像 │ │ L4 NLP │
└──────────┘ └──────────┘關鍵洞察:
- L1 是唯一的必經瓶頸,所有軌道都要過
- L2 表格是最短的完整路徑,新手 2 周可到「能獨立打完一場」
- L3 整合不需要深度學習,可以在純表格路徑上就學完
- L4 影像/NLP 需要 GPU 與 PyTorch,是完全不同的投入等級
3.1 各節點詳細規格
L0-1|Python + pandas
- 學成標誌:能獨立完成 讀 csv → 篩選 → groupby 聚合 → merge → 存檔
- 最短路徑:直接在真實資料上練,不要看語法教學
- 常見卡點:index 與 reset_index、SettingWithCopyWarning
- 時間:有程式基礎 2 天;完全沒有 2 週
L1-1|過擬合 ★核心
- 學成標誌:能解釋「為什麼訓練分數高不代表模型好」
- 驗證方式:給一個訓練 0.99 / 驗證 0.75 的結果,能說出問題與至少兩個解法
- 前置:無
- 時間:半天(概念)+ 持續內化
L1-2|交叉驗證 ★核心
- 學成標誌:看到一份資料能說出該用哪種切法及理由
- 驗證方式:給三個情境(使用者重複 / 時間序列 / 一般),能正確選出切法
- 前置:L1-1
- 時間:1 天
L1-3|折外預測(OOF) ★核心
- 學成標誌:能手寫產生 OOF 的迴圈,並解釋為什麼它是誠實的
- 驗證方式:能說出「為什麼 OOF 可以拿來做整合,而單純的訓練預測不行」
- 前置:L1-2
- 時間:半天
L1-4|評估指標
- 學成標誌:能手算自己比賽用的那個指標
- 驗證方式:給 10 筆預測與真值,手算曲線下面積(AUC)
- 前置:無
- 時間:1 天
L1-5|資料洩漏
- 學成標誌:能在別人的 notebook 裡找出洩漏
- 驗證方式:給一段有洩漏的特徵工程程式碼,能指出問題
- 前置:L1-2
- 時間:半天 + 長期敏感度累積
L1-6|基線與實驗紀律
- 學成標誌:每次只改一件事,並記錄結果
- 前置:L1-3
- 時間:習慣養成,非知識
L2-1|決策樹 → 梯度提升樹(GBDT)
- 學成標誌:能解釋一棵樹怎麼分裂,以及 boosting 為什麼有效
- 不需要:懂梯度推導
- 前置:L1 全部
- 時間:2 天
L2-2|特徵工程
- 學成標誌:能針對一份新資料提出 10 個特徵假設並排序
- 驗證方式:實際做出一個讓 CV 提升超過噪聲閾值的特徵
- 前置:L2-1
- 時間:持續,佔整體學習時間最大宗
L2-3|特徵重要性與篩選
- 學成標誌:知道 gain 會騙人,會用 permutation importance
- 前置:L2-2
L3-1|整合
- 學成標誌:能用自己的 OOF 檔案跑出比最佳單模型更好的組合
- 前置:L1-3 + 至少 5 個已存的 OOF
- 時間:2 天
- 注意:這是表格路徑的終點,不需要深度學習
L3-2|時間序列
- 學成標誌:能建立不洩漏未來資訊的滯後特徵
- 前置:L2-2
- 時間:1 週(觀念快,踩坑慢)
L3-3|PyTorch 基礎
- 學成標誌:能寫出訓練迴圈並跑通一個 MLP
- 前置:L2-1
- 時間:1 週
- 這是分水嶺:過了才能進 L4
L4-1|影像 / L4-2|NLP
- 前置:L3-3 + GPU 存取
- 時間:各 1 個月起
- 建議:第一年不要碰,先把表格路徑走完整
3.2 三條建議路徑
路徑 A|最短完賽路(新手推薦)
L0-1 → L1 全部 → L2-1 → L2-2 → 打完一場表格賽
約 3~4 週。終點:能獨立完成一場比賽並拿到合理名次。
路徑 B|表格精通路
路徑 A → L2-3 → L3-1 → L3-2 → 多場表格賽
約 3 個月。終點:能穩定拿銅牌以上,並具備真實業務能力。
路徑 C|全模態路
路徑 B → L3-3 → L4-1 或 L4-2
約 1 年。終點:能參與影像/NLP 賽事。
自我檢核:過關才前進(展開)
上面每個節點的「驗證方式」整理成一張清單。誠實地逐條自問,答不出來就回該節點——這比看完教材更能判斷你真的會了。全勾 = 路徑 A 畢業,可以獨立打完一場表格賽。
L1 心智核心(全部題型共用,一題卡住就別往下)
- 給我一份「訓練 0.99 / 驗證 0.75」的結果,我能說出問題是什麼,並給出至少兩個解法(過擬合)
- 給我三個情境——使用者重複出現、時間序列、一般資料——我能正確選出各自的 CV 切法並說出理由(交叉驗證)
- 我能手寫產生 OOF 的迴圈,並解釋為什麼 OOF 可以拿來做整合、單純的訓練預測不行(OOF)
- 給我 10 筆預測與真值,我能手算比賽用的指標(例如 AUC)(評估指標)
- 給我一段有洩漏的特徵工程程式碼,我能指出洩漏在哪(資料洩漏)
- 我的實驗每次只改一件事,而且有紀錄可回查(實驗紀律)
L2 表格骨幹(最短完賽路的技術面)
- 我能解釋一棵決策樹怎麼分裂,以及 boosting 為什麼有效——不需要會推導梯度(GBDT)
- 面對一份新資料,我能提出 10 個特徵假設並排出優先序;而且實際做出過一個讓 CV 提升超過噪聲閾值的特徵(特徵工程)
- 我知道 gain importance 會高估高基數特徵,會改用 permutation importance 驗證(特徵重要性)
L3 進階(路徑 B 才需要)
- 我能用自己存下的 OOF 檔案,跑出比最佳單模更好的組合(整合)
- 我能建立不洩漏未來資訊的滯後特徵,並用時間切分驗證(時間序列)
檢核的精神就是本站的方法論:驗證而非記憶。答不出來不是罪,拿驗證腳本自己跑一次,跑過就真的會了。