Aan de slagBegin gratis

Verschillen

Laten we eens kijken hoe je nieuwe features kunt maken op basis van bestaande. In het midwesten van de VS hebben veel eengezinswoningen extra grond eromheen als groenvoorziening. In dit voorbeeld maak je een nieuwe feature genaamd 'YARD_SIZE' en bekijk je vervolgens of deze nieuwe feature correleert met onze uitkomstvariabele.

Deze oefening maakt deel uit van de cursus

Feature Engineering met PySpark

Bekijk cursus

Oefeninstructies

  • Maak een nieuwe kolom met withColumn() genaamd LOT_SIZE_SQFT en zet ACRES om naar vierkante voet door te vermenigvuldigen met acres_to_sqfeet, de conversiefactor.
  • Maak nog een nieuwe kolom genaamd YARD_SIZE door FOUNDATIONSIZE af te trekken van LOT_SIZE_SQFT.
  • Voer corr() uit voor elk van de onafhankelijke variabelen YARD_SIZE, FOUNDATIONSIZE, LOT_SIZE_SQFT ten opzichte van de afhankelijke variabele SALESCLOSEPRICE. Laat de nieuwe feature een sterkere correlatie zien dan elk van de onderdelen?

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Lot size in square feet
acres_to_sqfeet = 43560
df = df.____(____, df[____] * ____)

# Create new column YARD_SIZE
df = df.____(____, df[____] - df[____])

# Corr of ACRES vs SALESCLOSEPRICE
print("Corr of ACRES vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE
print("Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of YARD_SIZE vs SALESCLOSEPRICE
print("Corr of YARD_SIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
Code bewerken en uitvoeren