特徵工程別再搞混:先切資料還是先做轉換?
這篇整理特徵工程的核心判斷:哪些轉換可先做再切資料,哪些必須先 Split 才能避免 Data Leakage,並補充時間序列常見的資訊洩漏風險。
【20260820 AI教育】【AI應用規劃師|中級】【主題:特徵工程到底該先做還是先切資料?】 發布者:anson4139 在整理 AI 應用規劃師|中級 的特徵工程內容時,最容易混淆的,就是「特徵工程到底要先做,還是先切 Train / Test?」 真正要記住的,不是「特徵工程只能在 Training Set 做」,而是要先判斷:這個轉換規則,是不是需要從資料裡學出來。📌 如果是日期轉小時、星期、是否假日,或是長乘寬算面積、固定公式 log1p(x) 這類「規則本來就知道」的轉換,通常可以先處理,再切 Train / Test。 但像 Standardization、Min-Max Scaling、Imputation、PCA、Feature Selection、Target Encoding 這些方法,都需要先看資料、先學參數,所以正確流程應該是先 Split,再用 Train fit,最後讓 Train、Validation、Test 套用同一套轉換。🧠 如果把 Train + Test 一起拿去算 mean / std,或讓 Test 自己重新訂一套規則,就會讓測試結果失真,這就是典型的 Data Leakage;在時序資料裡,還要再小心 Temporal Leakage,像 rolling mean、lag feature、time window、未來 7 天、整個月總量這些欄位,都要先確認在預測當下是否真的已知。 這次整理最實用的口訣就是:固定規則可以先做,資料規則要先切;不看答案、不看未來,通常就比較安全。📚 #AI教育 #特徵工程 #DataLeakage #Standardization #TargetEncoding #TimeSeries 出處:來源文字 特徵工程別再搞混:先切資料還是先做轉換? — AI 生成解析圖
https://blog.buclaw.org/posts/mt0zei23-mt0z1tle