CommencezCommencez gratuitement

Votre premier BOW

Un bag-of-words est une méthode qui transforme du texte en forme numérique.

Dans cet exercice, vous appliquerez un BOW à la liste annak avant de passer à un jeu de données plus volumineux au prochain exercice.

Votre tâche consiste à travailler avec cette liste et à appliquer un BOW à l'aide de CountVectorizer(). Cette transformation est votre première étape pour comprendre le sentiment d'un texte. Portez attention aux mots qui peuvent exprimer fortement un sentiment.

N'oubliez pas que le résultat d'un CountVectorizer() est une matrice creuse, qui ne stocke que les entrées non nulles. Pour voir le contenu réel de cette matrice, nous la convertissons en tableau dense avec la méthode .toarray().

Notez que, dans ce cas, vous n'avez pas besoin d'indiquer l'argument max_features puisque le texte est court.

Cette activité fait partie du cours

Analyse de sentiment en Python

Voir le cours

Instructions de l’exercice

  • Importez la fonction de vectorisation de comptes depuis sklearn.feature_extraction.text.
  • Créez et ajustez le vectoriseur sur le petit jeu de données.
  • Créez la représentation BOW nommée anna_bow en appelant la méthode transform().
  • Affichez le résultat du BOW sous forme de tableau dense.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import the required function
____

annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']

# Build the vectorizer and fit it
anna_vect = ____
____.____(annak)

# Create the bow representation
anna_bow = anna_vect.____(annak)

# Print the bag-of-words result 
print(anna_bow.toarray())
Modifier et exécuter le code