LoslegenKostenlos starten

Unterschiede

Lass uns erkunden, wie man aus bestehenden Merkmalen neue generiert. Im mittleren Westen der USA haben viele Einfamilienhäuser zusätzliches Land als Grünfläche. In diesem Beispiel erstellst du ein neues Merkmal namens 'YARD_SIZE' und prüfst dann, ob dieses neue Merkmal mit unserer Zielvariable korreliert.

Diese Übung ist Teil des Kurses

<Kurs>Feature Engineering mit PySpark</Kurs>
Kurs ansehen

Übungsanweisungen

  • Erstelle mit withColumn() eine neue Spalte namens LOT_SIZE_SQFT und wandle ACRES in Quadratfuß um, indem du mit dem Umrechnungsfaktor acres_to_sqfeet multiplizierst.
  • Erstelle eine weitere neue Spalte namens YARD_SIZE, indem du FOUNDATIONSIZE von LOT_SIZE_SQFT abziehst.
  • Führe corr() für jede der unabhängigen Variablen YARD_SIZE, FOUNDATIONSIZE, LOT_SIZE_SQFT gegen die abhängige Variable SALESCLOSEPRICE aus. Zeigt das neue Merkmal eine stärkere Korrelation als eine seiner Komponenten?

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Lot size in square feet
acres_to_sqfeet = 43560
df = df.____(____, df[____] * ____)

# Create new column YARD_SIZE
df = df.____(____, df[____] - df[____])

# Corr of ACRES vs SALESCLOSEPRICE
print("Corr of ACRES vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE
print("Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of YARD_SIZE vs SALESCLOSEPRICE
print("Corr of YARD_SIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
Code bearbeiten und ausführen