Kom igångKom igång gratis

Ta bort en lista med kolumner

Datamängden är rik på särdrag, men inte alla är värdefulla. Många av dem kommer att vara svåra att bearbeta till något användbart. Låt oss börja med att ta bort kolumner som inte är omedelbart relevanta.

  • 'STREETNUMBERNUMERIC': Postadressens husnummer
  • 'FIREPLACES': Antal öppna spisar i bostaden
  • 'LOTSIZEDIMENSIONS': Fritext som beskriver tomtens form
  • 'LISTTYPE': Fördefinierad lista med försäljningstyper
  • 'ACRES': Tomtytans numeriska storlek

Den här övningen är en del av kursen

Feature Engineering med PySpark

Visa kurs

Övningsinstruktioner

  • Läs igenom kolumnbeskrivningarna ovan och utforska de 30 vanligaste värdena med show() – dataramen är redan filtrerad till de listade kolumnerna som df
  • Skapa en lista med två kolumner att ta bort, baserat på att de saknar relevans för att förutsäga huspriser, och kalla den cols_to_drop. Kom ihåg att datorer bara tolkar siffror explicit och inte förstår sammanhang.
  • Använd funktionen drop() för att ta bort kolumnerna i listan cols_to_drop från dataramen df.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Show top 30 records
df.____(____)

# List of columns to remove from dataset
cols_to_drop = [____, ____]

# Drop columns in list
df = df.____(____)
Redigera och kör kod