Selectarea caracteristicilor relevante
În acest exercițiu, vei identifica coloanele redundante din setul de date volunteer și vei efectua selecția caracteristicilor pentru a obține un DataFrame cu atributele relevante.
De exemplu, dacă explorezi setul de date volunteer în consolă, vei observa trei caracteristici legate de locație: locality, region și postalcode. Acestea conțin informații similare, deci are sens să păstrezi doar una dintre ele.
Examinează caracteristicile din volunteer în consolă și încearcă să identifici caracteristicile redundante.
Acest exercițiu face parte din cursul
Preprocesare pentru Machine Learning în Python
Instrucțiuni pentru exercițiu
- Creează o listă cu numele coloanelor redundante și stocheaz-o în variabila
to_drop:- Din toate caracteristicile legate de locație, păstrează doar
postalcode. - Caracteristicile care au trecut prin procesul de inginerie a caracteristicilor sunt, de asemenea, redundante.
- Din toate caracteristicile legate de locație, păstrează doar
- Elimină coloanele din lista
to_dropdin setul de date. - Afișează
.head()al variabileivolunteer_subsetpentru a vedea coloanele selectate.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create a list of redundant column names to drop
to_drop = ["____", "____", "____", "____", "____"]
# Drop those columns from the dataset
volunteer_subset = ____.____(____, ____)
# Print out the head of volunteer_subset
print(____)