Unterschiede
Lass uns erkunden, wie man aus bestehenden Merkmalen neue generiert. Im mittleren Westen der USA haben viele Einfamilienhäuser zusätzliches Land als Grünfläche. In diesem Beispiel erstellst du ein neues Merkmal namens 'YARD_SIZE' und prüfst dann, ob dieses neue Merkmal mit unserer Zielvariable korreliert.
Diese Übung ist Teil des Kurses
<Kurs>Feature Engineering mit PySpark</Kurs>Übungsanweisungen
- Erstelle mit
withColumn()eine neue Spalte namensLOT_SIZE_SQFTund wandleACRESin Quadratfuß um, indem du mit dem Umrechnungsfaktoracres_to_sqfeetmultiplizierst. - Erstelle eine weitere neue Spalte namens
YARD_SIZE, indem duFOUNDATIONSIZEvonLOT_SIZE_SQFTabziehst. - Führe
corr()für jede der unabhängigen VariablenYARD_SIZE,FOUNDATIONSIZE,LOT_SIZE_SQFTgegen die abhängige VariableSALESCLOSEPRICEaus. Zeigt das neue Merkmal eine stärkere Korrelation als eine seiner Komponenten?
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Lot size in square feet
acres_to_sqfeet = 43560
df = df.____(____, df[____] * ____)
# Create new column YARD_SIZE
df = df.____(____, df[____] - df[____])
# Corr of ACRES vs SALESCLOSEPRICE
print("Corr of ACRES vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE
print("Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of YARD_SIZE vs SALESCLOSEPRICE
print("Corr of YARD_SIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))