Verschillen
Laten we eens kijken hoe je nieuwe features kunt maken op basis van bestaande. In het midwesten van de VS hebben veel eengezinswoningen extra grond eromheen als groenvoorziening. In dit voorbeeld maak je een nieuwe feature genaamd 'YARD_SIZE' en bekijk je vervolgens of deze nieuwe feature correleert met onze uitkomstvariabele.
Deze oefening maakt deel uit van de cursus
Feature Engineering met PySpark
Oefeninstructies
- Maak een nieuwe kolom met
withColumn()genaamdLOT_SIZE_SQFTen zetACRESom naar vierkante voet door te vermenigvuldigen metacres_to_sqfeet, de conversiefactor. - Maak nog een nieuwe kolom genaamd
YARD_SIZEdoorFOUNDATIONSIZEaf te trekken vanLOT_SIZE_SQFT. - Voer
corr()uit voor elk van de onafhankelijke variabelenYARD_SIZE,FOUNDATIONSIZE,LOT_SIZE_SQFTten opzichte van de afhankelijke variabeleSALESCLOSEPRICE. Laat de nieuwe feature een sterkere correlatie zien dan elk van de onderdelen?
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Lot size in square feet
acres_to_sqfeet = 43560
df = df.____(____, df[____] * ____)
# Create new column YARD_SIZE
df = df.____(____, df[____] - df[____])
# Corr of ACRES vs SALESCLOSEPRICE
print("Corr of ACRES vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE
print("Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of YARD_SIZE vs SALESCLOSEPRICE
print("Corr of YARD_SIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))