Ta bort en lista med kolumner
Datamängden är rik på särdrag, men inte alla är värdefulla. Många av dem kommer att vara svåra att bearbeta till något användbart. Låt oss börja med att ta bort kolumner som inte är omedelbart relevanta.
'STREETNUMBERNUMERIC': Postadressens husnummer'FIREPLACES': Antal öppna spisar i bostaden'LOTSIZEDIMENSIONS': Fritext som beskriver tomtens form'LISTTYPE': Fördefinierad lista med försäljningstyper'ACRES': Tomtytans numeriska storlek
Den här övningen är en del av kursen
Feature Engineering med PySpark
Övningsinstruktioner
- Läs igenom kolumnbeskrivningarna ovan och utforska de 30 vanligaste värdena med
show()– dataramen är redan filtrerad till de listade kolumnerna somdf - Skapa en lista med två kolumner att ta bort, baserat på att de saknar relevans för att förutsäga huspriser, och kalla den
cols_to_drop. Kom ihåg att datorer bara tolkar siffror explicit och inte förstår sammanhang. - Använd funktionen
drop()för att ta bort kolumnerna i listancols_to_dropfrån dataramendf.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Show top 30 records
df.____(____)
# List of columns to remove from dataset
cols_to_drop = [____, ____]
# Drop columns in list
df = df.____(____)