CommencezCommencez gratuitement

Transformer paresseusement les données d'entraînement

Le prétraitement de vos variables d'entrée est une étape essentielle en Machine Learning et améliore souvent la précision du modèle que vous créez. Dans les derniers exercices, les données de Spotify étaient déjà prétraitées pour vous, mais il est important de savoir le faire vous-même.

Dans cet exercice, vous utiliserez l'objet StandardScaler(), qui transforme les colonnes d'un tableau pour qu'elles aient une moyenne de zéro et un écart type de un.

La Dask DataFrame de chansons Spotify est disponible dans votre environnement sous le nom dask_df. Elle contient à la fois les cibles de popularité et les variables d'entrée que vous avez utilisées pour prédire ces scores.

Cette activité fait partie du cours

Programmation parallèle avec Dask en Python

Voir le cours

Instructions de l’exercice

  • Importez la classe StandardScaler() à partir de dask_ml.preprocessing.
  • Sélectionnez la colonne 'popularity' de la DataFrame et assignez-la à la variable y.
  • Créez un objet StandardScaler et ajustez-le aux données X.
  • Utilisez le normaliseur pour transformer X.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import the StandardScaler class
from ____ import ____

X = dask_df[['duration_ms', 'explicit', 'danceability', 'acousticness', 'instrumentalness', 'tempo']]

# Select the target variable
y = ____

# Create a StandardScaler object and fit it on X
scaler = ____
scaler.____(____)

# Transform X
X = scaler.____
print(X)
Modifier et exécuter le code