Transformer paresseusement les données d'entraînement
Le prétraitement de vos variables d'entrée est une étape essentielle en Machine Learning et améliore souvent la précision du modèle que vous créez. Dans les derniers exercices, les données de Spotify étaient déjà prétraitées pour vous, mais il est important de savoir le faire vous-même.
Dans cet exercice, vous utiliserez l'objet StandardScaler(), qui transforme les colonnes d'un tableau pour qu'elles aient une moyenne de zéro et un écart type de un.
La Dask DataFrame de chansons Spotify est disponible dans votre environnement sous le nom dask_df. Elle contient à la fois les cibles de popularité et les variables d'entrée que vous avez utilisées pour prédire ces scores.
Cette activité fait partie du cours
Programmation parallèle avec Dask en Python
Instructions de l’exercice
- Importez la classe
StandardScaler()à partir dedask_ml.preprocessing. - Sélectionnez la colonne
'popularity'de la DataFrame et assignez-la à la variabley. - Créez un objet
StandardScaleret ajustez-le aux donnéesX. - Utilisez le normaliseur pour transformer
X.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import the StandardScaler class
from ____ import ____
X = dask_df[['duration_ms', 'explicit', 'danceability', 'acousticness', 'instrumentalness', 'tempo']]
# Select the target variable
y = ____
# Create a StandardScaler object and fit it on X
scaler = ____
scaler.____(____)
# Transform X
X = scaler.____
print(X)