Mettre les données à l'échelle
Pour les algorithmes de ML basés sur des mesures de distance, il est crucial de toujours mettre vos données à l'échelle, car des variables sur des échelles différentes fausseront vos résultats. K-means utilise la distance euclidienne pour mesurer la distance aux centroïdes des regroupements; vous devez donc d'abord mettre vos données à l'échelle avant de continuer l'implantation de l'algorithme. Faisons cela en premier.
Vous avez à disposition la trame de données df de l'exercice précédent, déjà légèrement préparée pour être utilisée avec sklearn. Les étiquettes de fraude sont stockées séparément dans labels; vous pourrez les utiliser plus tard pour valider les résultats. numpy a été importé sous le nom np.
Cette activité fait partie du cours
Détection de fraude en Python
Instructions de l’exercice
- Importez
MinMaxScaler. - Transformez votre trame de données
dfen un tableau numpyXen ne prenant que les valeurs dedfet assurez-vous qu'elles sont toutes de typefloat. - Appliquez le normaliseur défini à
Xpour obtenir les valeurs mises à l'échelleX_scaledet forcer toutes vos variables à l'intervalle 0–1.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import the scaler
from sklearn.preprocessing import ____
# Take the float values of df for X
X = df.values.astype(np.____)
# Define the scaler and apply to the data
scaler = ____()
X_scaled = scaler.____(X)