Výběr relevantních příznaků
V tomto cvičení identifikuješ nadbytečné sloupce v datasetu volunteer a provedeš výběr příznaků, jehož výsledkem bude DataFrame obsahující pouze relevantní příznaky.
Pokud si například prohlédneš dataset volunteer v konzoli, uvidíš tři příznaky související s polohou: locality, region a postalcode. Obsahují podobné informace, takže dává smysl ponechat pouze jeden z nich.
Prohledej příznaky datasetu volunteer v konzoli a zkus identifikovat ty nadbytečné.
Toto cvičení je součástí kurzu
Preprocessing pro Machine Learning v Pythonu
Pokyny k cvičení
- Vytvoř seznam názvů nadbytečných sloupců a ulož ho do proměnné
to_drop:- Ze všech příznaků souvisejících s polohou ponech pouze
postalcode. - Nadbytečné jsou také příznaky, které prošly procesem feature engineeringu.
- Ze všech příznaků souvisejících s polohou ponech pouze
- Odstraň sloupce ze seznamu
to_dropz datasetu. - Vypiš
.head()proměnnévolunteer_subset, abys viděl/a vybrané sloupce.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a list of redundant column names to drop
to_drop = ["____", "____", "____", "____", "____"]
# Drop those columns from the dataset
volunteer_subset = ____.____(____, ____)
# Print out the head of volunteer_subset
print(____)