Skillnader
Nu ska vi utforska hur man skapar nya särdrag utifrån befintliga. I mellanvästern i USA har många enfamiljshus extra mark runt sig som grönyta. I den här övningen skapar du ett nytt särdrag kallat 'YARD_SIZE' och undersöker sedan om det nya särdragets är korrelerat med vår utfallsvariabel.
Den här övningen är en del av kursen
Feature Engineering med PySpark
Övningsinstruktioner
- Skapa en ny kolumn med
withColumn()kalladLOT_SIZE_SQFToch konverteraACREStill kvadratfot genom att multiplicera med omvandlingsfaktornacres_to_sqfeet. - Skapa ytterligare en ny kolumn kallad
YARD_SIZEgenom att subtraheraFOUNDATIONSIZEfrånLOT_SIZE_SQFT. - Kör
corr()för var och en av de oberoende variablernaYARD_SIZE,FOUNDATIONSIZEochLOT_SIZE_SQFTmot den beroende variabelnSALESCLOSEPRICE. Visar det nya särdragets en starkare korrelation än någon av dess ingående komponenter?
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Lot size in square feet
acres_to_sqfeet = 43560
df = df.____(____, df[____] * ____)
# Create new column YARD_SIZE
df = df.____(____, df[____] - df[____])
# Corr of ACRES vs SALESCLOSEPRICE
print("Corr of ACRES vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE
print("Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of YARD_SIZE vs SALESCLOSEPRICE
print("Corr of YARD_SIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))