Faire correspondre les indices de caractéristiques aux noms de caractéristiques
Dans la vidéo de la leçon, nous avons vu que CountVectorizer n'indexe pas nécessairement le vocabulaire par ordre alphabétique. Dans cet exercice, vous allez apprendre à faire correspondre chaque indice de caractéristique à son nom correspondant dans le vocabulaire.
Nous allons réutiliser les trois phrases sur les lions présentées dans la vidéo. Elles sont disponibles dans une liste nommée corpus et ont déjà été affichées à la console.
Cette activité fait partie du cours
Ingénierie des caractéristiques pour le NLP en Python
Instructions de l’exercice
- Instanciez un objet
CountVectorizer. Nommez-levectorizer. - À l'aide de
fit_transform(), générezbow_matrixpourcorpus. - À l'aide de la méthode
get_feature_names(), associez les noms de colonnes au mot correspondant dans le vocabulaire.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create CountVectorizer object
vectorizer = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())
# Map the column names to vocabulary
bow_df.columns = vectorizer.____
# Print bow_df
print(bow_df)