Prétraiter les données RFM
Nous avons chargé l'ensemble de données avec les valeurs RFM que vous avez calculées plus tôt sous le nom datamart_rfm. Comme les variables sont asymétriques et sur des échelles différentes, vous allez maintenant les désasymétriser et les normaliser.
La bibliothèque pandas est chargée sous pd, et numpy sous np. Prenez un moment pour explorer datamart_rfm dans la console.
Cette activité fait partie du cours
Segmentation de la clientèle en Python
Instructions de l’exercice
- Appliquez une transformation logarithmique pour corriger l'asymétrie de
datamart_rfmet enregistrez le résultat dansdatamart_log. - Initialisez une instance de
StandardScaler()nomméescaleret ajustez-la (fit) sur les donnéesdatamart_log. - Transformez les
dataen les mettant à l'échelle et en les centrant avecscaler. - Créez un DataFrame pandas à partir de « datamart_normalized » en y ajoutant l'index et les noms de colonnes provenant de
datamart_rfm.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Unskew the data
datamart_log = np.____(____)
# Initialize a standard scaler and fit it
scaler = ____()
scaler.____(____)
# Scale and center the data
datamart_normalized = ____.____(____)
# Create a pandas DataFrame
datamart_normalized = pd.____(data=____, index=____.index, columns=____.columns)