回帰のための中心化とスケーリング
データのスケーリングの効果を確認したところで、次はパイプラインを使って music_df の特徴量を前処理し、曲の音量を予測する Lasso 回帰モデルを構築しましょう。
X_train データセットから X_test、y_train、y_test、music_df が作成済みです。目的変数は "loudness" で、特徴量はデータセットの他のすべての列です。Lasso と Pipeline もインポート済みです。
なお、"genre" はバイナリ特徴量に変換されており、1 はロック曲、0 はその他のジャンルを表します。
この演習はコースの一部です
scikit-learn による教師あり学習
演習の手順
StandardScalerをインポートします。- パイプラインオブジェクト用のステップを作成します。
StandardScalerという名前の"scaler"オブジェクトと、"lasso"をalphaに設定した0.5という名前の Lasso モデルを用意します。 - スケーリングと Lasso 回帰モデルの構築を行うステップを持つパイプラインをインスタンス化します。
- テストデータで決定係数を計算します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import StandardScaler
____
# Create pipeline steps
steps = [("____", ____()),
("____", ____(alpha=____))]
# Instantiate the pipeline
pipeline = ____(____)
pipeline.fit(X_train, y_train)
# Calculate and print R-squared
print(____.____(____, ____))