Zacznij terazZacznij za darmo

Leniwe przekształcanie danych treningowych

Przetwarzanie wstępne zmiennych wejściowych to kluczowy krok w uczeniu maszynowym, który często poprawia dokładność tworzonego modelu. W poprzednich ćwiczeniach dane Spotify były już wstępnie przetworzone, ale ważne jest, żebyś umiał(-a) zrobić to samodzielnie.

W tym ćwiczeniu użyjesz obiektu StandardScaler(), który przekształca kolumny tablicy tak, by miały średnią równą zero i odchylenie standardowe równe jeden.

Dask DataFrame z danymi Spotify jest dostępny w środowisku pod nazwą dask_df. Zawiera zarówno docelowe wyniki popularności, jak i zmienne wejściowe używane do ich przewidywania.

To ćwiczenie jest częścią kursu

Programowanie równoległe z Dask w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj klasę StandardScaler() z dask_ml.preprocessing.
  • Wybierz kolumnę 'popularity' z DataFrame i przypisz ją do zmiennej y.
  • Utwórz obiekt StandardScaler i dopasuj go do danych X.
  • Użyj skalera, aby przekształcić X.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import the StandardScaler class
from ____ import ____

X = dask_df[['duration_ms', 'explicit', 'danceability', 'acousticness', 'instrumentalness', 'tempo']]

# Select the target variable
y = ____

# Create a StandardScaler object and fit it on X
scaler = ____
scaler.____(____)

# Transform X
X = scaler.____
print(X)
Edytuj i uruchom kod