Kom igångKom igång gratis

Centrering och skalning för regression

Nu när du har sett fördelarna med att skala dina data ska du använda en pipeline för att förbehandla särdragen i music_df och bygga en lasso-regressionsmodell som förutsäger en låts ljudnivå.

X_train, X_test, y_train och y_test har skapats från datamängden music_df, där målet är "loudness" och särdragen är alla övriga kolumner. Lasso och Pipeline har också importerats åt dig.

Observera att "genre" har konverterats till ett binärt särdrag där 1 anger att det är en rocklåt och 0 representerar övriga genrer.

Den här övningen är en del av kursen

Övervakad inlärning med scikit-learn

Visa kurs

Övningsinstruktioner

  • Importera StandardScaler.
  • Skapa stegen för pipeline-objektet: ett StandardScaler-objekt med namnet "scaler" och en lasso-modell med namnet "lasso" där alpha är satt till 0.5.
  • Instansiera en pipeline med steg för att skala data och bygga en lasso-regressionsmodell.
  • Beräkna R-kvadratvärdet på testdata.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import StandardScaler
____

# Create pipeline steps
steps = [("____", ____()),
         ("____", ____(alpha=____))]

# Instantiate the pipeline
pipeline = ____(____)
pipeline.fit(X_train, y_train)

# Calculate and print R-squared
print(____.____(____, ____))
Redigera och kör kod