始める無料で始める

lasso 回帰のためにデータをスケーリングする

lasso 回帰モデルを適合させる前準備として、すべての特徴量が互いに比較可能になるようにデータをスケーリングすることが重要です。King County, California の住宅販売データ全体は house_sales_df にあります。

この演習では、データを学習用とテスト用に分割する前に、目的変数 price を個別にスケーリングします。これは tidymodels の recipe の仕組みによるものです。recipe には目的変数の変換を含めません。

tidyversetidymodels パッケージはすでに読み込まれています。

この演習はコースの一部です

Rによる次元削減

コースを見る

演習の手順

  • house_sales_df の目的変数 pricescale() でスケーリングします。
  • 学習用データ 80%・テスト用データ 20% となるように分割します。
  • 学習用データを使って recipe を作成し、数値の説明変数をすべてスケーリングします。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Scale the target variable
house_sales_df <-  ___ %>% 
  mutate(price = as.vector(___(___)))

# Create the training and testing sets
split <- ___(___, prop = ___)
train <- ___ %>% ___()
test <-  ___ %>% ___()

# Create recipe to scale the predictors
lasso_recipe <- 
  ___(___ ~ ., data = ___) %>% 
  ___(___()) 
コードを編集して実行