Différences
Explorons la création de variables à partir de celles qui existent déjà. Dans le Midwest des États-Unis, de nombreuses maisons individuelles disposent de terrain autour d’elles pour des espaces verts. Dans cet exemple, vous allez créer une nouvelle variable appelée 'YARD_SIZE', puis vérifier si cette nouvelle variable est corrélée avec notre variable cible.
Cet exercice fait partie du cours
<cours>Feature Engineering avec PySpark</cours>Instructions de l’exercice
- Créez une nouvelle colonne avec
withColumn()appeléeLOT_SIZE_SQFTet convertissezACRESen pieds carrés en multipliant paracres_to_sqfeet, le facteur de conversion. - Créez une autre nouvelle colonne appelée
YARD_SIZEen soustrayantFOUNDATIONSIZEdeLOT_SIZE_SQFT. - Exécutez
corr()sur chacune des variables indépendantesYARD_SIZE,FOUNDATIONSIZE,LOT_SIZE_SQFTpar rapport à la variable dépendanteSALESCLOSEPRICE. Cette nouvelle variable montre-t-elle une corrélation plus forte que chacune de ses composantes ?
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Lot size in square feet
acres_to_sqfeet = 43560
df = df.____(____, df[____] * ____)
# Create new column YARD_SIZE
df = df.____(____, df[____] - df[____])
# Corr of ACRES vs SALESCLOSEPRICE
print("Corr of ACRES vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE
print("Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of YARD_SIZE vs SALESCLOSEPRICE
print("Corr of YARD_SIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))