Lat transformering av träningsdata
Att förbehandla dina indatavariabler är ett viktigt steg i maskininlärning och förbättrar ofta noggrannheten hos den modell du skapar. I de senaste övningarna förbehandlades Spotify-datan åt dig, men det är viktigt att du vet hur du gör det själv.
I den här övningen använder du skalerobjektet StandardScaler(), som transformerar kolumnerna i en array så att de får medelvärdet noll och standardavvikelsen ett.
Dask-dataramen med Spotify-låtar finns tillgänglig i din miljö som dask_df. Den innehåller både målvärdena för popularitet och de indatavariabler som du använde för att förutsäga dessa värden.
Den här övningen är en del av kursen
Parallellprogrammering med Dask i Python
Övningsinstruktioner
- Importera klassen
StandardScaler()fråndask_ml.preprocessing. - Välj kolumnen
'popularity'från dataramen och tilldela den till variabelny. - Skapa ett
StandardScaler-objekt och anpassa det tillX-datan. - Använd skalern för att transformera
X.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import the StandardScaler class
from ____ import ____
X = dask_df[['duration_ms', 'explicit', 'danceability', 'acousticness', 'instrumentalness', 'tempo']]
# Select the target variable
y = ____
# Create a StandardScaler object and fit it on X
scaler = ____
scaler.____(____)
# Transform X
X = scaler.____
print(X)