Inizia subitoInizia gratis

Differenze

Esploriamo come generare feature a partire da quelle esistenti. Nel Midwest degli Stati Uniti molte case unifamiliari hanno del terreno extra intorno come area verde. In questo esempio creerai una nuova feature chiamata 'YARD_SIZE' e poi verificherai se è correlata con la nostra variabile di outcome.

Questo esercizio fa parte del corso

Feature Engineering con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Crea una nuova colonna usando withColumn() chiamata LOT_SIZE_SQFT e converti ACRES in piedi quadrati moltiplicando per acres_to_sqfeet, il fattore di conversione.
  • Crea un'altra nuova colonna chiamata YARD_SIZE sottraendo FOUNDATIONSIZE da LOT_SIZE_SQFT.
  • Esegui corr() su ognuna delle variabili indipendenti YARD_SIZE, FOUNDATIONSIZE, LOT_SIZE_SQFT rispetto alla variabile dipendente SALESCLOSEPRICE. La nuova feature mostra una correlazione più forte rispetto a ciascuno dei suoi componenti?

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Lot size in square feet
acres_to_sqfeet = 43560
df = df.____(____, df[____] * ____)

# Create new column YARD_SIZE
df = df.____(____, df[____] - df[____])

# Corr of ACRES vs SALESCLOSEPRICE
print("Corr of ACRES vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE
print("Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of YARD_SIZE vs SALESCLOSEPRICE
print("Corr of YARD_SIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
Modifica ed esegui il codice