Wybór istotnych cech
W tym ćwiczeniu zidentyfikujesz zbędne kolumny w zbiorze danych volunteer, a następnie przeprowadzisz selekcję cech, żeby uzyskać DataFrame zawierający tylko te istotne.
Na przykład – jeśli przejrzysz zbiór danych volunteer w konsoli, zobaczysz trzy cechy związane z lokalizacją: locality, region i postalcode. Zawierają pokrewne informacje, więc sensowne jest zachowanie tylko jednej z nich.
Poświęć chwilę na przejrzenie cech zbioru volunteer w konsoli i spróbuj wskazać te, które są zbędne.
To ćwiczenie jest częścią kursu
Preprocessing w uczeniu maszynowym w Pythonie
Instrukcje do ćwiczenia
- Utwórz listę nazw zbędnych kolumn i zapisz ją w zmiennej
to_drop:- Spośród wszystkich cech związanych z lokalizacją zachowaj tylko
postalcode. - Cechy, które przeszły przez proces inżynierii cech, również są zbędne.
- Spośród wszystkich cech związanych z lokalizacją zachowaj tylko
- Usuń kolumny z listy
to_dropze zbioru danych. - Wyświetl
.head()zmiennejvolunteer_subset, żeby zobaczyć wybrane kolumny.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a list of redundant column names to drop
to_drop = ["____", "____", "____", "____", "____"]
# Drop those columns from the dataset
volunteer_subset = ____.____(____, ____)
# Print out the head of volunteer_subset
print(____)