Selectarea setului de date ideal
Acum este momentul să eliminăm câteva caracteristici inutile din setul de date ufo. Deoarece coloana country a fost codificată ca country_enc, o poți păstra pe aceasta și elimina celelalte coloane legate de locație: city, country, lat, long și state.
Ai creat coloanele month și year, așa că nu mai ai nevoie de coloanele date sau recorded. De asemenea, ai standardizat coloana seconds sub forma seconds_log, deci poți elimina seconds și minutes.
Ai vectorizat desc, așa că o poți șterge. Deocamdată, vei păstra type.
Poți elimina și coloana length_of_time, care nu mai este necesară după extragerea coloanei minutes.
Acest exercițiu face parte din cursul
Preprocesare pentru Machine Learning în Python
Instrucțiuni pentru exercițiu
- Creează o listă cu toate coloanele de eliminat,
to_drop. - Elimină aceste coloane din
ufo. - Folosește funcția
words_to_filter()creată anterior; transmitevocab,vec.vocabulary_,desc_tfidfși păstrează primele4cuvinte ca ultim parametru.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Make a list of features to drop
to_drop = [____]
# Drop those features
ufo_dropped = ufo.____
# Let's also filter some words out of the text vector we created
filtered_words = ____(____, ____, ____, ____)