CommencezCommencez gratuitement

Choisir l'ensemble de données idéal

Il est maintenant temps d'éliminer certaines variables inutiles dans l'ensemble ufo. Comme la colonne country a été encodée en country_enc, vous pouvez la conserver et supprimer les autres colonnes liées à l'emplacement : city, country, lat, long et state.

Vous avez créé les colonnes month et year, donc vous n'avez plus besoin de date ni de recorded. Vous avez aussi normalisé la colonne seconds en seconds_log, donc vous pouvez supprimer seconds et minutes.

Vous avez vectorisé desc, donc elle peut être retirée. Pour l'instant, vous garderez type.

Vous pouvez également supprimer la colonne length_of_time, devenue inutile après l'extraction de minutes.

Cette activité fait partie du cours

Prétraitement pour le Machine Learning en Python

Voir le cours

Instructions de l’exercice

  • Créez une liste de toutes les colonnes à supprimer, to_drop.
  • Supprimez ces colonnes de ufo.
  • Utilisez la fonction words_to_filter() que vous avez créée précédemment; passez vocab, vec.vocabulary_, desc_tfidf, et conservez les 4 mots les plus fréquents comme dernier paramètre.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Make a list of features to drop
to_drop = [____]

# Drop those features
ufo_dropped = ufo.____

# Let's also filter some words out of the text vector we created
filtered_words = ____(____, ____, ____, ____)
Modifier et exécuter le code