Zacznij terazZacznij za darmo

Wybór istotnych cech

W tym ćwiczeniu zidentyfikujesz zbędne kolumny w zbiorze danych volunteer, a następnie przeprowadzisz selekcję cech, żeby uzyskać DataFrame zawierający tylko te istotne.

Na przykład – jeśli przejrzysz zbiór danych volunteer w konsoli, zobaczysz trzy cechy związane z lokalizacją: locality, region i postalcode. Zawierają pokrewne informacje, więc sensowne jest zachowanie tylko jednej z nich.

Poświęć chwilę na przejrzenie cech zbioru volunteer w konsoli i spróbuj wskazać te, które są zbędne.

To ćwiczenie jest częścią kursu

Preprocessing w uczeniu maszynowym w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz listę nazw zbędnych kolumn i zapisz ją w zmiennej to_drop:
    • Spośród wszystkich cech związanych z lokalizacją zachowaj tylko postalcode.
    • Cechy, które przeszły przez proces inżynierii cech, również są zbędne.
  • Usuń kolumny z listy to_drop ze zbioru danych.
  • Wyświetl .head() zmiennej volunteer_subset, żeby zobaczyć wybrane kolumny.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create a list of redundant column names to drop
to_drop = ["____", "____", "____", "____", "____"]

# Drop those columns from the dataset
volunteer_subset = ____.____(____, ____)

# Print out the head of volunteer_subset
print(____)
Edytuj i uruchom kod