Choisir l'ensemble de données idéal
Il est maintenant temps d'éliminer certaines variables inutiles dans l'ensemble ufo. Comme la colonne country a été encodée en country_enc, vous pouvez la conserver et supprimer les autres colonnes liées à l'emplacement : city, country, lat, long et state.
Vous avez créé les colonnes month et year, donc vous n'avez plus besoin de date ni de recorded. Vous avez aussi normalisé la colonne seconds en seconds_log, donc vous pouvez supprimer seconds et minutes.
Vous avez vectorisé desc, donc elle peut être retirée. Pour l'instant, vous garderez type.
Vous pouvez également supprimer la colonne length_of_time, devenue inutile après l'extraction de minutes.
Cette activité fait partie du cours
Prétraitement pour le Machine Learning en Python
Instructions de l’exercice
- Créez une liste de toutes les colonnes à supprimer,
to_drop. - Supprimez ces colonnes de
ufo. - Utilisez la fonction
words_to_filter()que vous avez créée précédemment; passezvocab,vec.vocabulary_,desc_tfidf, et conservez les4mots les plus fréquents comme dernier paramètre.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Make a list of features to drop
to_drop = [____]
# Drop those features
ufo_dropped = ufo.____
# Let's also filter some words out of the text vector we created
filtered_words = ____(____, ____, ____, ____)