Eine Liste von Spalten entfernen
Unser Datensatz ist reich an Features, aber nicht alle sind wertvoll. Viele davon sind schwer so aufzubereiten, dass sie nützlich werden. Entfernen wir zunächst alle Spalten, die nicht sofort hilfreich sind, indem wir sie droppen.
'STREETNUMBERNUMERIC': Die Hausnummer in der Postadresse'FIREPLACES': Anzahl der Kamine im Haus'LOTSIZEDIMENSIONS': Freitextbeschreibung der Grundstücksform'LISTTYPE': Vordefinierte Ausprägungen des Verkaufstyps'ACRES': Numerische Fläche der Grundstücksgröße
Diese Übung ist Teil des Kurses
<Kurs>Feature Engineering mit PySpark</Kurs>Übungsanweisungen
- Lies die obigen Spaltenbeschreibungen und untersuche ihre Top-30-Werte mit
show(). Das DataFrame ist bereits auf die genannten Spalten alsdfgefiltert. - Erstelle eine Liste mit zwei zu entfernenden Spalten basierend auf ihrer mangelnden Relevanz für die Vorhersage von Hauspreisen und nenne sie
cols_to_drop. Denk daran: Computer interpretieren nur Zahlen explizit und verstehen keinen Kontext. - Verwende die Funktion
drop(), um die incols_to_dropenthaltenen Spalten aus dem DataFramedfzu entfernen.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Show top 30 records
df.____(____)
# List of columns to remove from dataset
cols_to_drop = [____, ____]
# Drop columns in list
df = df.____(____)