CommencezCommencez gratuitement

Utiliser corr()

Le vieil adage « la corrélation n'implique pas la causalité » est un avertissement utile. Cela dit, la corrélation nous donne une bonne piste pour savoir où commencer à repérer des caractéristiques prometteuses à utiliser dans nos modèles. Servez-vous de cet exercice pour vous familiariser avec une première exploration de vos données afin d'y déceler des motifs.

Une liste appelée columns contenant des noms de colonnes a été créée pour vous. Dans cet exercice, vous calculerez la corrélation entre ces colonnes et 'SALESCLOSEPRICE', puis vous trouverez la valeur maximale.

Cette activité fait partie du cours

Ingénierie des caractéristiques avec PySpark

Voir le cours

Instructions de l’exercice

  • Utilisez une boucle for pour parcourir columns.
  • À chaque itération, calculez la corrélation entre la colonne courante et 'SALESCLOSEPRICE' à l'aide de la méthode corr().
  • Ajoutez une logique pour mettre à jour la corrélation maximale observée ainsi que la colonne correspondante.
  • Affichez le nom de la colonne qui présente la corrélation maximale avec 'SALESCLOSEPRICE'.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]

# Loop to check all columns contained in list
for ____ in ____:
    # Check the correlation of a pair of columns
    corr_val = df.____(____, ____)
    # Logic to compare corr_max with current corr_val
    if ____ ____ ____:
        # Update the column name and corr value
        corr_max = corr_val
        corr_max_col = col

print(corr_max_col)
Modifier et exécuter le code