Transformarea leneșă a datelor de antrenament
Preprocesarea variabilelor de intrare este un pas esențial în învățarea automată și îmbunătățește adesea acuratețea modelului pe care îl creezi. În ultimele exerciții, datele Spotify au fost preprocesate pentru tine, însă este important să știi cum să faci asta singur.
În acest exercițiu, vei folosi obiectul scaler StandardScaler(), care transformă coloanele unui array astfel încât să aibă media zero și deviația standard unu.
DataFrame-ul Dask cu melodii Spotify este disponibil în mediul tău ca dask_df. Conține atât scorurile țintă de popularitate, cât și variabilele de intrare pe care le-ai folosit pentru a prezice aceste scoruri.
Acest exercițiu face parte din cursul
Programare paralelă cu Dask în Python
Instrucțiuni pentru exercițiu
- Importă clasa
StandardScaler()dindask_ml.preprocessing. - Selectează coloana
'popularity'din DataFrame și atribuie-o variabileiy. - Creează un obiect
StandardScalerși antrenează-l pe dateleX. - Folosește scalerul pentru a transforma
X.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import the StandardScaler class
from ____ import ____
X = dask_df[['duration_ms', 'explicit', 'danceability', 'acousticness', 'instrumentalness', 'tempo']]
# Select the target variable
y = ____
# Create a StandardScaler object and fit it on X
scaler = ____
scaler.____(____)
# Transform X
X = scaler.____
print(X)