CommencerCommencez gratuitement

Utiliser corr()

Le vieil adage « corrélation n’implique pas causalité » est un avertissement utile. Cela dit, la corrélation nous donne une bonne piste pour identifier par où commencer à chercher des variables intéressantes à utiliser dans nos modèles. Servez-vous de cet exercice pour vous familiariser avec l’exploration initiale de vos données et la recherche de motifs.

Une liste appelée columns contenant des noms de colonnes a été créée pour vous. Dans cet exercice, vous allez calculer la corrélation entre ces colonnes et 'SALESCLOSEPRICE', puis trouver la valeur maximale.

Cet exercice fait partie du cours

<cours>Feature Engineering avec PySpark</cours>
Voir le cours

Instructions de l’exercice

  • Utilisez une boucle for pour itérer sur columns.
  • À chaque itération, calculez la corrélation entre la colonne courante et 'SALESCLOSEPRICE' avec la méthode corr().
  • Ajoutez une logique pour mettre à jour la corrélation maximale observée et la colonne associée.
  • Affichez le nom de la colonne qui présente la corrélation maximale avec 'SALESCLOSEPRICE'.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]

# Loop to check all columns contained in list
for ____ in ____:
    # Check the correlation of a pair of columns
    corr_val = df.____(____, ____)
    # Logic to compare corr_max with current corr_val
    if ____ ____ ____:
        # Update the column name and corr value
        corr_max = corr_val
        corr_max_col = col

print(corr_max_col)
Modifier et exécuter le code