特徴量エンジニアリングのパイプラインを完成させる
recipes パッケージは、複数の特徴量エンジニアリング手順を1つのオブジェクトにまとめ、Machine Learning のワークフローでデータ変換を管理しやすくするためのものです。
この演習では、モデリングに向けて通信業データを前処理する特徴量エンジニアリングのパイプラインを学習します。
telecom_df の tibble と、前の演習で作成した telecom_training および telecom_test データセットは、すでにワークスペースに読み込まれています。
この演習はコースの一部です
R での tidymodels によるモデリング
演習の手順
- 訓練データのすべての説明変数を使って
canceled_serviceを予測するレシピを作成します。 - しきい値 0.8 を用いて、相関の高い説明変数を削除します。
- すべての数値の説明変数を正規化します。
- すべてのカテゴリ型(名義尺度)の説明変数についてダミー変数を作成します。
- レシピを訓練データで学習し、テストデータに適用します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create a recipe that predicts canceled_service using the training data
telecom_recipe <- ___ %>%
# Remove correlated predictors
___ %>%
# Normalize numeric predictors
___ %>%
# Create dummy variables
___
# Train your recipe and apply it to the test data
telecom_recipe %>%
___ %>%
___