CommencezCommencez gratuitement

Repérer les mots les plus fréquents

Il est toujours recommandé, une fois vos caractéristiques créées, de les examiner pour confirmer qu'elles correspondent à vos attentes. Cela vous permettra de détecter rapidement des erreurs et, au besoin, d'orienter la suite de votre ingénierie de caractéristiques.

Le vectoriseur (cv) que vous avez entraîné à l'exercice précédent ainsi que le tableau creux des comptes de mots (cv_trigram) sont disponibles dans votre espace de travail.

Cette activité fait partie du cours

Ingénierie des caractéristiques pour le Machine Learning en Python

Voir le cours

Instructions de l’exercice

  • Créez un DataFrame à partir des caractéristiques (comptes de mots).
  • Additionnez les occurrences des mots et affichez les 5 mots les plus fréquents.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a DataFrame of the features
cv_tri_df = ____(____, 
                 columns=cv_trigram_vec.get_feature_names()).add_prefix('Counts_')

# Print the top 5 words in the sorted output
print(cv_tri_df.sum().____(ascending=____).head())
Modifier et exécuter le code