Utiliser corr()
Le vieil adage « corrélation n’implique pas causalité » est un avertissement utile. Cela dit, la corrélation nous donne une bonne piste pour identifier par où commencer à chercher des variables intéressantes à utiliser dans nos modèles. Servez-vous de cet exercice pour vous familiariser avec l’exploration initiale de vos données et la recherche de motifs.
Une liste appelée columns contenant des noms de colonnes a été créée pour vous. Dans cet exercice, vous allez calculer la corrélation entre ces colonnes et 'SALESCLOSEPRICE', puis trouver la valeur maximale.
Cet exercice fait partie du cours
<cours>Feature Engineering avec PySpark</cours>Instructions de l’exercice
- Utilisez une boucle
forpour itérer surcolumns. - À chaque itération, calculez la corrélation entre la colonne courante et
'SALESCLOSEPRICE'avec la méthodecorr(). - Ajoutez une logique pour mettre à jour la corrélation maximale observée et la colonne associée.
- Affichez le nom de la colonne qui présente la corrélation maximale avec
'SALESCLOSEPRICE'.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]
# Loop to check all columns contained in list
for ____ in ____:
# Check the correlation of a pair of columns
corr_val = df.____(____, ____)
# Logic to compare corr_max with current corr_val
if ____ ____ ____:
# Update the column name and corr value
corr_max = corr_val
corr_max_col = col
print(corr_max_col)