CommencezCommencez gratuitement

Mettre les données à l'échelle

Pour les algorithmes de ML basés sur des mesures de distance, il est crucial de toujours mettre vos données à l'échelle, car des variables sur des échelles différentes fausseront vos résultats. K-means utilise la distance euclidienne pour mesurer la distance aux centroïdes des regroupements; vous devez donc d'abord mettre vos données à l'échelle avant de continuer l'implantation de l'algorithme. Faisons cela en premier.

Vous avez à disposition la trame de données df de l'exercice précédent, déjà légèrement préparée pour être utilisée avec sklearn. Les étiquettes de fraude sont stockées séparément dans labels; vous pourrez les utiliser plus tard pour valider les résultats. numpy a été importé sous le nom np.

Cette activité fait partie du cours

Détection de fraude en Python

Voir le cours

Instructions de l’exercice

  • Importez MinMaxScaler.
  • Transformez votre trame de données df en un tableau numpy X en ne prenant que les valeurs de df et assurez-vous qu'elles sont toutes de type float.
  • Appliquez le normaliseur défini à X pour obtenir les valeurs mises à l'échelle X_scaled et forcer toutes vos variables à l'intervalle 0–1.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import the scaler
from sklearn.preprocessing import ____

# Take the float values of df for X
X = df.values.astype(np.____)

# Define the scaler and apply to the data
scaler = ____()
X_scaled = scaler.____(X)
Modifier et exécuter le code