前処理
Feature engineering の時間です! 観測 ID のように情報量は低いものの有用かもしれない変数への対応や、欠損値の処理を行うレシピを作成しましょう。また、いくつかの予測子を変換するよい機会でもあります。例えば、数値特徴量を正規化し、カテゴリ型のものにはダミー変数を作成します。
attritionデータセットと、前の演習で作成したtrainおよびtestの分割は、すでにあなたの環境に用意されています。
この演習はコースの一部です
Rで学ぶ特徴量エンジニアリング
演習の手順
- すべての数値特徴量を正規化します。
knnインピュテーションアルゴリズムで欠損値を補完します。- すべての名義尺度の予測子についてダミー変数を作成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
recipe <- recipe(Attrition ~ ., data = train) %>%
update_role(...1, new_role = "ID") %>%
# Normalize all numeric features
___(all_numeric_predictors()) %>%
# Impute missing values using the knn imputation algorithm
___(all_predictors()) %>%
# Create dummy variables for all nominal predictors
___(all_nominal_predictors())
recipe