LoslegenKostenlos starten

Eine Liste von Spalten entfernen

Unser Datensatz ist reich an Features, aber nicht alle sind wertvoll. Viele davon sind schwer so aufzubereiten, dass sie nützlich werden. Entfernen wir zunächst alle Spalten, die nicht sofort hilfreich sind, indem wir sie droppen.

  • 'STREETNUMBERNUMERIC': Die Hausnummer in der Postadresse
  • 'FIREPLACES': Anzahl der Kamine im Haus
  • 'LOTSIZEDIMENSIONS': Freitextbeschreibung der Grundstücksform
  • 'LISTTYPE': Vordefinierte Ausprägungen des Verkaufstyps
  • 'ACRES': Numerische Fläche der Grundstücksgröße

Diese Übung ist Teil des Kurses

<Kurs>Feature Engineering mit PySpark</Kurs>
Kurs ansehen

Übungsanweisungen

  • Lies die obigen Spaltenbeschreibungen und untersuche ihre Top-30-Werte mit show(). Das DataFrame ist bereits auf die genannten Spalten als df gefiltert.
  • Erstelle eine Liste mit zwei zu entfernenden Spalten basierend auf ihrer mangelnden Relevanz für die Vorhersage von Hauspreisen und nenne sie cols_to_drop. Denk daran: Computer interpretieren nur Zahlen explizit und verstehen keinen Kontext.
  • Verwende die Funktion drop(), um die in cols_to_drop enthaltenen Spalten aus dem DataFrame df zu entfernen.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Show top 30 records
df.____(____)

# List of columns to remove from dataset
cols_to_drop = [____, ____]

# Drop columns in list
df = df.____(____)
Code bearbeiten und ausführen