Zacznij terazZacznij za darmo

Różnice

Przeanalizujmy tworzenie nowych cech na podstawie już istniejących. W środkowej części USA wiele domów jednorodzinnych otaczają działki z zielenią. W tym ćwiczeniu stworzysz nową cechę o nazwie 'YARD_SIZE', a następnie sprawdzisz, czy ma ona korelację ze zmienną wynikową.

To ćwiczenie jest częścią kursu

Inżynieria cech z PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz nową kolumnę za pomocą withColumn() o nazwie LOT_SIZE_SQFT i przelicz wartości z ACRES na stopy kwadratowe, mnożąc przez współczynnik konwersji acres_to_sqfeet.
  • Utwórz kolejną nową kolumnę o nazwie YARD_SIZE, odejmując FOUNDATIONSIZE od LOT_SIZE_SQFT.
  • Uruchom corr() dla każdej z niezależnych zmiennych YARD_SIZE, FOUNDATIONSIZE, LOT_SIZE_SQFT względem zmiennej zależnej SALESCLOSEPRICE. Czy nowa cecha wykazuje silniejszą korelację niż każdy z jej składników?

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Lot size in square feet
acres_to_sqfeet = 43560
df = df.____(____, df[____] * ____)

# Create new column YARD_SIZE
df = df.____(____, df[____] - df[____])

# Corr of ACRES vs SALESCLOSEPRICE
print("Corr of ACRES vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE
print("Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of YARD_SIZE vs SALESCLOSEPRICE
print("Corr of YARD_SIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
Edytuj i uruchom kod