Centrering och skalning för regression
Nu när du har sett fördelarna med att skala dina data ska du använda en pipeline för att förbehandla särdragen i music_df och bygga en lasso-regressionsmodell som förutsäger en låts ljudnivå.
X_train, X_test, y_train och y_test har skapats från datamängden music_df, där målet är "loudness" och särdragen är alla övriga kolumner. Lasso och Pipeline har också importerats åt dig.
Observera att "genre" har konverterats till ett binärt särdrag där 1 anger att det är en rocklåt och 0 representerar övriga genrer.
Den här övningen är en del av kursen
Övervakad inlärning med scikit-learn
Övningsinstruktioner
- Importera
StandardScaler. - Skapa stegen för pipeline-objektet: ett
StandardScaler-objekt med namnet"scaler"och en lasso-modell med namnet"lasso"däralphaär satt till0.5. - Instansiera en pipeline med steg för att skala data och bygga en lasso-regressionsmodell.
- Beräkna R-kvadratvärdet på testdata.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import StandardScaler
____
# Create pipeline steps
steps = [("____", ____()),
("____", ____(alpha=____))]
# Instantiate the pipeline
pipeline = ____(____)
pipeline.fit(X_train, y_train)
# Calculate and print R-squared
print(____.____(____, ____))