CommencezCommencez gratuitement

Faire correspondre les indices de caractéristiques aux noms de caractéristiques

Dans la vidéo de la leçon, nous avons vu que CountVectorizer n'indexe pas nécessairement le vocabulaire par ordre alphabétique. Dans cet exercice, vous allez apprendre à faire correspondre chaque indice de caractéristique à son nom correspondant dans le vocabulaire.

Nous allons réutiliser les trois phrases sur les lions présentées dans la vidéo. Elles sont disponibles dans une liste nommée corpus et ont déjà été affichées à la console.

Cette activité fait partie du cours

Ingénierie des caractéristiques pour le NLP en Python

Voir le cours

Instructions de l’exercice

  • Instanciez un objet CountVectorizer. Nommez-le vectorizer.
  • À l'aide de fit_transform(), générez bow_matrix pour corpus.
  • À l'aide de la méthode get_feature_names(), associez les noms de colonnes au mot correspondant dans le vocabulaire.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create CountVectorizer object
vectorizer = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())

# Map the column names to vocabulary 
bow_df.columns = vectorizer.____

# Print bow_df
print(bow_df)
Modifier et exécuter le code