ÎncepețiÎncepe gratuit

Selectarea caracteristicilor relevante

În acest exercițiu, vei identifica coloanele redundante din setul de date volunteer și vei efectua selecția caracteristicilor pentru a obține un DataFrame cu atributele relevante.

De exemplu, dacă explorezi setul de date volunteer în consolă, vei observa trei caracteristici legate de locație: locality, region și postalcode. Acestea conțin informații similare, deci are sens să păstrezi doar una dintre ele.

Examinează caracteristicile din volunteer în consolă și încearcă să identifici caracteristicile redundante.

Acest exercițiu face parte din cursul

Preprocesare pentru Machine Learning în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează o listă cu numele coloanelor redundante și stocheaz-o în variabila to_drop:
    • Din toate caracteristicile legate de locație, păstrează doar postalcode.
    • Caracteristicile care au trecut prin procesul de inginerie a caracteristicilor sunt, de asemenea, redundante.
  • Elimină coloanele din lista to_drop din setul de date.
  • Afișează .head() al variabilei volunteer_subset pentru a vedea coloanele selectate.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create a list of redundant column names to drop
to_drop = ["____", "____", "____", "____", "____"]

# Drop those columns from the dataset
volunteer_subset = ____.____(____, ____)

# Print out the head of volunteer_subset
print(____)
Editează și rulează codul