Leniwe przekształcanie danych treningowych
Przetwarzanie wstępne zmiennych wejściowych to kluczowy krok w uczeniu maszynowym, który często poprawia dokładność tworzonego modelu. W poprzednich ćwiczeniach dane Spotify były już wstępnie przetworzone, ale ważne jest, żebyś umiał(-a) zrobić to samodzielnie.
W tym ćwiczeniu użyjesz obiektu StandardScaler(), który przekształca kolumny tablicy tak, by miały średnią równą zero i odchylenie standardowe równe jeden.
Dask DataFrame z danymi Spotify jest dostępny w środowisku pod nazwą dask_df. Zawiera zarówno docelowe wyniki popularności, jak i zmienne wejściowe używane do ich przewidywania.
To ćwiczenie jest częścią kursu
Programowanie równoległe z Dask w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj klasę
StandardScaler()zdask_ml.preprocessing. - Wybierz kolumnę
'popularity'z DataFrame i przypisz ją do zmiennejy. - Utwórz obiekt
StandardScaleri dopasuj go do danychX. - Użyj skalera, aby przekształcić
X.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the StandardScaler class
from ____ import ____
X = dask_df[['duration_ms', 'explicit', 'danceability', 'acousticness', 'instrumentalness', 'tempo']]
# Select the target variable
y = ____
# Create a StandardScaler object and fit it on X
scaler = ____
scaler.____(____)
# Transform X
X = scaler.____
print(X)