Kom igångKom igång gratis

Skillnader

Nu ska vi utforska hur man skapar nya särdrag utifrån befintliga. I mellanvästern i USA har många enfamiljshus extra mark runt sig som grönyta. I den här övningen skapar du ett nytt särdrag kallat 'YARD_SIZE' och undersöker sedan om det nya särdragets är korrelerat med vår utfallsvariabel.

Den här övningen är en del av kursen

Feature Engineering med PySpark

Visa kurs

Övningsinstruktioner

  • Skapa en ny kolumn med withColumn() kallad LOT_SIZE_SQFT och konvertera ACRES till kvadratfot genom att multiplicera med omvandlingsfaktorn acres_to_sqfeet.
  • Skapa ytterligare en ny kolumn kallad YARD_SIZE genom att subtrahera FOUNDATIONSIZE från LOT_SIZE_SQFT.
  • Kör corr() för var och en av de oberoende variablerna YARD_SIZE, FOUNDATIONSIZE och LOT_SIZE_SQFT mot den beroende variabeln SALESCLOSEPRICE. Visar det nya särdragets en starkare korrelation än någon av dess ingående komponenter?

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Lot size in square feet
acres_to_sqfeet = 43560
df = df.____(____, df[____] * ____)

# Create new column YARD_SIZE
df = df.____(____, df[____] - df[____])

# Corr of ACRES vs SALESCLOSEPRICE
print("Corr of ACRES vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE
print("Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of YARD_SIZE vs SALESCLOSEPRICE
print("Corr of YARD_SIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
Redigera och kör kod