Začněte nyníZačněte zdarma

Výběr relevantních příznaků

V tomto cvičení identifikuješ nadbytečné sloupce v datasetu volunteer a provedeš výběr příznaků, jehož výsledkem bude DataFrame obsahující pouze relevantní příznaky.

Pokud si například prohlédneš dataset volunteer v konzoli, uvidíš tři příznaky související s polohou: locality, region a postalcode. Obsahují podobné informace, takže dává smysl ponechat pouze jeden z nich.

Prohledej příznaky datasetu volunteer v konzoli a zkus identifikovat ty nadbytečné.

Toto cvičení je součástí kurzu

Preprocessing pro Machine Learning v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř seznam názvů nadbytečných sloupců a ulož ho do proměnné to_drop:
    • Ze všech příznaků souvisejících s polohou ponech pouze postalcode.
    • Nadbytečné jsou také příznaky, které prošly procesem feature engineeringu.
  • Odstraň sloupce ze seznamu to_drop z datasetu.
  • Vypiš .head() proměnné volunteer_subset, abys viděl/a vybrané sloupce.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create a list of redundant column names to drop
to_drop = ["____", "____", "____", "____", "____"]

# Drop those columns from the dataset
volunteer_subset = ____.____(____, ____)

# Print out the head of volunteer_subset
print(____)
Upravit a spustit kód