lasso 回帰のためにデータをスケーリングする
lasso 回帰モデルを適合させる前準備として、すべての特徴量が互いに比較可能になるようにデータをスケーリングすることが重要です。King County, California の住宅販売データ全体は house_sales_df にあります。
この演習では、データを学習用とテスト用に分割する前に、目的変数 price を個別にスケーリングします。これは tidymodels の recipe の仕組みによるものです。recipe には目的変数の変換を含めません。
tidyverse と tidymodels パッケージはすでに読み込まれています。
この演習はコースの一部です
Rによる次元削減
演習の手順
house_sales_dfの目的変数priceをscale()でスケーリングします。- 学習用データ 80%・テスト用データ 20% となるように分割します。
- 学習用データを使って recipe を作成し、数値の説明変数をすべてスケーリングします。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Scale the target variable
house_sales_df <- ___ %>%
mutate(price = as.vector(___(___)))
# Create the training and testing sets
split <- ___(___, prop = ___)
train <- ___ %>% ___()
test <- ___ %>% ___()
# Create recipe to scale the predictors
lasso_recipe <-
___(___ ~ ., data = ___) %>%
___(___())