Usuwanie listy kolumn
Nasz zbiór danych jest bogaty w wiele cech, ale nie wszystkie są wartościowe. Niektóre z nich będzie bardzo trudno przetworzyć w coś użytecznego. Na razie usuńmy kolumny, które nie są bezpośrednio przydatne do analizy.
'STREETNUMBERNUMERIC': Numer adresu pocztowego nieruchomości'FIREPLACES': Liczba kominków w domu'LOTSIZEDIMENSIONS': Dowolny tekst opisujący kształt działki'LISTTYPE': Predefiniowana lista wartości typu sprzedaży'ACRES': Numeryczna powierzchnia działki
To ćwiczenie jest częścią kursu
Inżynieria cech z PySpark
Instrukcje do ćwiczenia
- Przeczytaj powyższe opisy kolumn i przejrzyj ich 30 najpopularniejszych wartości za pomocą
show(). Ramka danych jest już przefiltrowana do wymienionych kolumn i dostępna jakodf. - Utwórz listę dwóch kolumn do usunięcia ze względu na ich brak związku z przewidywaniem cen domów i nazwij ją
cols_to_drop. Pamiętaj, że komputer interpretuje wyłącznie liczby i nie rozumie kontekstu. - Użyj funkcji
drop(), aby usunąć z ramki danychdfkolumny znajdujące się na liściecols_to_drop.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Show top 30 records
df.____(____)
# List of columns to remove from dataset
cols_to_drop = [____, ____]
# Drop columns in list
df = df.____(____)