始める無料で始める

回帰のための中心化とスケーリング

データのスケーリングの効果を確認したところで、次はパイプラインを使って music_df の特徴量を前処理し、曲の音量を予測する Lasso 回帰モデルを構築しましょう。

X_train データセットから X_testy_trainy_testmusic_df が作成済みです。目的変数は "loudness" で、特徴量はデータセットの他のすべての列です。LassoPipeline もインポート済みです。

なお、"genre" はバイナリ特徴量に変換されており、1 はロック曲、0 はその他のジャンルを表します。

この演習はコースの一部です

scikit-learn による教師あり学習

コースを見る

演習の手順

  • StandardScaler をインポートします。
  • パイプラインオブジェクト用のステップを作成します。StandardScaler という名前の "scaler" オブジェクトと、"lasso"alpha に設定した 0.5 という名前の Lasso モデルを用意します。
  • スケーリングと Lasso 回帰モデルの構築を行うステップを持つパイプラインをインスタンス化します。
  • テストデータで決定係数を計算します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import StandardScaler
____

# Create pipeline steps
steps = [("____", ____()),
         ("____", ____(alpha=____))]

# Instantiate the pipeline
pipeline = ____(____)
pipeline.fit(X_train, y_train)

# Calculate and print R-squared
print(____.____(____, ____))
コードを編集して実行