CommencerCommencez gratuitement

Différences

Explorons la création de variables à partir de celles qui existent déjà. Dans le Midwest des États-Unis, de nombreuses maisons individuelles disposent de terrain autour d’elles pour des espaces verts. Dans cet exemple, vous allez créer une nouvelle variable appelée 'YARD_SIZE', puis vérifier si cette nouvelle variable est corrélée avec notre variable cible.

Cet exercice fait partie du cours

<cours>Feature Engineering avec PySpark</cours>
Voir le cours

Instructions de l’exercice

  • Créez une nouvelle colonne avec withColumn() appelée LOT_SIZE_SQFT et convertissez ACRES en pieds carrés en multipliant par acres_to_sqfeet, le facteur de conversion.
  • Créez une autre nouvelle colonne appelée YARD_SIZE en soustrayant FOUNDATIONSIZE de LOT_SIZE_SQFT.
  • Exécutez corr() sur chacune des variables indépendantes YARD_SIZE, FOUNDATIONSIZE, LOT_SIZE_SQFT par rapport à la variable dépendante SALESCLOSEPRICE. Cette nouvelle variable montre-t-elle une corrélation plus forte que chacune de ses composantes ?

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Lot size in square feet
acres_to_sqfeet = 43560
df = df.____(____, df[____] * ____)

# Create new column YARD_SIZE
df = df.____(____, df[____] - df[____])

# Corr of ACRES vs SALESCLOSEPRICE
print("Corr of ACRES vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE
print("Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of YARD_SIZE vs SALESCLOSEPRICE
print("Corr of YARD_SIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
Modifier et exécuter le code