插補遺漏值並建立虛擬變數
在 attrition 資料集中偵測到遺漏值,並判定其為完全隨機缺失(MCAR)後,你決定使用 K 近鄰(KNN)插補。在設定你的特徵工程 recipe 時,你打算為所有名目變數建立虛擬變數,並將 ...1 變數的角色更新為「ID」,讓你可以把它保留在資料集中作為參考,而不影響模型。
本練習屬於課程
R 的特徵工程
練習說明
- 將
...1的角色更新為「ID」。 - 對所有有遺漏值的預測變數進行插補。
- 為所有名目的預測變數建立虛擬變數。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
lr_model <- logistic_reg()
lr_recipe <-
recipe(Attrition ~., data = train) %>%
# Update the role of "...1" to "ID"
___(...1, new_role = "ID" ) %>%
# Impute values to all predictors where data are missing
step_impute_knn(___) %>%
# Create dummy variables for all nominal predictors
___(all_nominal_predictors())
lr_recipe