Differenze
Esploriamo come generare feature a partire da quelle esistenti. Nel Midwest degli Stati Uniti molte case unifamiliari hanno del terreno extra intorno come area verde. In questo esempio creerai una nuova feature chiamata 'YARD_SIZE' e poi verificherai se è correlata con la nostra variabile di outcome.
Questo esercizio fa parte del corso
Feature Engineering con PySpark
Istruzioni dell'esercizio
- Crea una nuova colonna usando
withColumn()chiamataLOT_SIZE_SQFTe convertiACRESin piedi quadrati moltiplicando peracres_to_sqfeet, il fattore di conversione. - Crea un'altra nuova colonna chiamata
YARD_SIZEsottraendoFOUNDATIONSIZEdaLOT_SIZE_SQFT. - Esegui
corr()su ognuna delle variabili indipendentiYARD_SIZE,FOUNDATIONSIZE,LOT_SIZE_SQFTrispetto alla variabile dipendenteSALESCLOSEPRICE. La nuova feature mostra una correlazione più forte rispetto a ciascuno dei suoi componenti?
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Lot size in square feet
acres_to_sqfeet = 43560
df = df.____(____, df[____] * ____)
# Create new column YARD_SIZE
df = df.____(____, df[____] - df[____])
# Corr of ACRES vs SALESCLOSEPRICE
print("Corr of ACRES vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE
print("Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of YARD_SIZE vs SALESCLOSEPRICE
print("Corr of YARD_SIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))