S SealHack

快速版:最短完賽路

每階段只做一件核心的事,約 3–4 週能獨立完成一場表格賽。想深入再點進完整版。

本頁內容

定位:⚡ 進階七步(同一條路、每步多一層理由)| ⏱ 約 15 分 · 前置:做過一次🐣 手冊最好

想要每個階段的完整深度?看0 診斷 起的六個階段頁。

解題方法有兩個深度,先挑一個:

  • 快速版(這頁) —— 每階段只留一件必要動作。目標是先完成一場比賽,不追求刷榜。約 3–4 週,對應下方學習地圖的路徑 A。
  • 完整版 —— 左側「照順序學」裡 0 診斷 起的各階段頁,每階段的完整深度(消融、防過擬合、代理實驗…)。刷牌、精通時再用。

新手先走快速版;每一步卡住或想深入,點該階段的連結進完整版。

最短完賽路(七步)

階段只做這一件事為什麼
0 診斷五問路由:模態→任務→指標→test 怎麼切→code 賽?先定交叉驗證(CV)切法。這步錯(例:時間序列用隨機切),後面全錯,而且 AI 不會告訴你
0.5 清洗樹模型(LightGBM)別填補——它原生處理 NaN;只加一欄 is_missing。見清洗填補會抹掉「缺失本身的訊號」;過度清洗是白工
1 鎖 CV24 小時內跑通「讀檔 → 最簡特徵 → LightGBM → 提交」,折外預測(OOF)落盤。見鎖死驗證有一次成功提交前,不要碰特徵工程;OOF 是後面一切的原料
2 基線先跑一次 AutoGluon 當錨點 + 一個 LightGBM;資料 ≤5 萬列一定試 TabPFN。見多樣化基線錨點告訴你「不做人工特徵能到哪」,贏不過它代表方向錯
3 特徵一次加一組,在同一組折上算配對差、t>2 才留;群組聚合 + 差值/比值最有效。見特徵迭代一次加十組=不知道哪組有用;配對比較才看得見小樣本的訊號
4 集成小樣本(n≲3000)直接跳過,用單模 + 多 seed 平均;資料夠大才爬山。見集成小樣本湊不出實力相近的成員,爬山只會過擬合 OOF
5 提交選 2 份:CV 最高 + 最穩健;交之前檢查行數 / NaN / 欄名 / ID 順序。見收尾與提交絕不兩份都挑 public 排行榜(LB)最高;格式錯直接 0 分

什麼時候升級到完整版

不管哪個版本,鐵律不變:先學會診斷,再讓 AI 動手;每個決定都用可重跑的驗證撐著,不要照抄別人的方案。

學習地圖:先修什麼、走哪條路(展開)

先修什麼、走哪條路——這不是線性課程,是有向圖:

3.0 依賴關係(不是線性課程,是有向圖)

                    ┌─────────────────────────┐
   L0 前置          │ Python 基礎 / pandas    │
                    └───────────┬─────────────┘

                    ┌─────────────────────────┐
   L1 心智核心      │ 過擬合 → 交叉驗證 → OOF │  ★ 全部題型共用
                    │ 指標 / 泄漏 / 基線      │
                    └───────────┬─────────────┘

                    ┌─────────────────────────┐
   L2 表格骨幹      │ 決策樹 → GBDT           │  ★ 投報率最高
                    │ 特徵工程 / 特徵重要性   │
                    └───────────┬─────────────┘

        ┌───────────────────────┼───────────────────────┐
        ↓                       ↓                       ↓
   ┌─────────┐          ┌──────────────┐        ┌──────────────┐
   │ L3 集成 │          │ L3 時間序列  │        │ L3 深度學習  │
   │ 爬山/堆疊│         │ 時間切分/滯後│        │ PyTorch 基礎 │
   └─────────┘          └──────────────┘        └──────┬───────┘

                                            ┌───────────┴──────────┐
                                            ↓                      ↓
                                      ┌──────────┐          ┌──────────┐
                                      │ L4 影像  │          │ L4 NLP   │
                                      └──────────┘          └──────────┘

關鍵洞察:

  • L1 是唯一的必經瓶頸,所有軌道都要過
  • L2 表格是最短的完整路徑,新手 2 周可到「能獨立打完一場」
  • L3 整合不需要深度學習,可以在純表格路徑上就學完
  • L4 影像/NLP 需要 GPU 與 PyTorch,是完全不同的投入等級

3.1 各節點詳細規格

L0-1|Python + pandas

  • 學成標誌:能獨立完成 讀 csv → 篩選 → groupby 聚合 → merge → 存檔
  • 最短路徑:直接在真實資料上練,不要看語法教學
  • 常見卡點:index 與 reset_index、SettingWithCopyWarning
  • 時間:有程式基礎 2 天;完全沒有 2 週

L1-1|過擬合 ★核心

  • 學成標誌:能解釋「為什麼訓練分數高不代表模型好」
  • 驗證方式:給一個訓練 0.99 / 驗證 0.75 的結果,能說出問題與至少兩個解法
  • 前置:無
  • 時間:半天(概念)+ 持續內化

L1-2|交叉驗證 ★核心

  • 學成標誌:看到一份資料能說出該用哪種切法及理由
  • 驗證方式:給三個情境(使用者重複 / 時間序列 / 一般),能正確選出切法
  • 前置:L1-1
  • 時間:1 天

L1-3|折外預測(OOF) ★核心

  • 學成標誌:能手寫產生 OOF 的迴圈,並解釋為什麼它是誠實的
  • 驗證方式:能說出「為什麼 OOF 可以拿來做整合,而單純的訓練預測不行」
  • 前置:L1-2
  • 時間:半天

L1-4|評估指標

  • 學成標誌:能手算自己比賽用的那個指標
  • 驗證方式:給 10 筆預測與真值,手算曲線下面積(AUC)
  • 前置:無
  • 時間:1 天

L1-5|資料洩漏

  • 學成標誌:能在別人的 notebook 裡找出洩漏
  • 驗證方式:給一段有洩漏的特徵工程程式碼,能指出問題
  • 前置:L1-2
  • 時間:半天 + 長期敏感度累積

L1-6|基線與實驗紀律

  • 學成標誌:每次只改一件事,並記錄結果
  • 前置:L1-3
  • 時間:習慣養成,非知識

L2-1|決策樹 → 梯度提升樹(GBDT)

  • 學成標誌:能解釋一棵樹怎麼分裂,以及 boosting 為什麼有效
  • 不需要:懂梯度推導
  • 前置:L1 全部
  • 時間:2 天

L2-2|特徵工程

  • 學成標誌:能針對一份新資料提出 10 個特徵假設並排序
  • 驗證方式:實際做出一個讓 CV 提升超過噪聲閾值的特徵
  • 前置:L2-1
  • 時間:持續,佔整體學習時間最大宗

L2-3|特徵重要性與篩選

  • 學成標誌:知道 gain 會騙人,會用 permutation importance
  • 前置:L2-2

L3-1|整合

  • 學成標誌:能用自己的 OOF 檔案跑出比最佳單模型更好的組合
  • 前置:L1-3 + 至少 5 個已存的 OOF
  • 時間:2 天
  • 注意:這是表格路徑的終點,不需要深度學習

L3-2|時間序列

  • 學成標誌:能建立不洩漏未來資訊的滯後特徵
  • 前置:L2-2
  • 時間:1 週(觀念快,踩坑慢)

L3-3|PyTorch 基礎

  • 學成標誌:能寫出訓練迴圈並跑通一個 MLP
  • 前置:L2-1
  • 時間:1 週
  • 這是分水嶺:過了才能進 L4

L4-1|影像 / L4-2|NLP

  • 前置:L3-3 + GPU 存取
  • 時間:各 1 個月起
  • 建議:第一年不要碰,先把表格路徑走完整

3.2 三條建議路徑

路徑 A|最短完賽路(新手推薦)

L0-1 → L1 全部 → L2-1 → L2-2 → 打完一場表格賽 約 3~4 週。終點:能獨立完成一場比賽並拿到合理名次。

路徑 B|表格精通路

路徑 A → L2-3 → L3-1 → L3-2 → 多場表格賽 約 3 個月。終點:能穩定拿銅牌以上,並具備真實業務能力。

路徑 C|全模態路

路徑 B → L3-3 → L4-1 或 L4-2 約 1 年。終點:能參與影像/NLP 賽事。

自我檢核:過關才前進(展開)

上面每個節點的「驗證方式」整理成一張清單。誠實地逐條自問,答不出來就回該節點——這比看完教材更能判斷你真的會了。全勾 = 路徑 A 畢業,可以獨立打完一場表格賽。

L1 心智核心(全部題型共用,一題卡住就別往下)

  • 給我一份「訓練 0.99 / 驗證 0.75」的結果,我能說出問題是什麼,並給出至少兩個解法(過擬合)
  • 給我三個情境——使用者重複出現、時間序列、一般資料——我能正確選出各自的 CV 切法並說出理由(交叉驗證)
  • 我能手寫產生 OOF 的迴圈,並解釋為什麼 OOF 可以拿來做整合、單純的訓練預測不行(OOF)
  • 給我 10 筆預測與真值,我能手算比賽用的指標(例如 AUC)(評估指標)
  • 給我一段有洩漏的特徵工程程式碼,我能指出洩漏在哪(資料洩漏)
  • 我的實驗每次只改一件事,而且有紀錄可回查(實驗紀律)

L2 表格骨幹(最短完賽路的技術面)

  • 我能解釋一棵決策樹怎麼分裂,以及 boosting 為什麼有效——不需要會推導梯度(GBDT)
  • 面對一份新資料,我能提出 10 個特徵假設並排出優先序;而且實際做出過一個讓 CV 提升超過噪聲閾值的特徵(特徵工程)
  • 我知道 gain importance 會高估高基數特徵,會改用 permutation importance 驗證(特徵重要性)

L3 進階(路徑 B 才需要)

  • 我能用自己存下的 OOF 檔案,跑出比最佳單模更好的組合(整合)
  • 我能建立不洩漏未來資訊的滯後特徵,並用時間切分驗證(時間序列)

檢核的精神就是本站的方法論:驗證而非記憶。答不出來不是罪,拿驗證腳本自己跑一次,跑過就真的會了。