CommencezCommencez gratuitement

Spécifier la longueur des séquences de jetons avec BOW

Comme on l'a vu dans la vidéo, en précisant différentes longueurs de jetons — ce que nous appelons des n-grammes — on capte mieux le contexte, ce qui peut être très important.

Dans cet exercice, vous travaillerez avec un échantillon d'avis de produits Amazon. Votre tâche consiste à construire un vocabulaire BOW à partir de la colonne review et à préciser la longueur des séquences de jetons.

Cette activité fait partie du cours

Analyse de sentiment en Python

Voir le cours

Instructions de l’exercice

  • Construisez le vectoriseur en précisant que la longueur des séquences de jetons doit être des uni-grammes et des bi-grammes.
  • Ajustez (fit) le vectoriseur.
  • Transformez avec le vectoriseur ajusté.
  • Dans le DataFrame, assurez-vous d'indiquer correctement les noms de colonnes.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)

# Transform the review column
X_review = vect.____(reviews.review)

# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())
Modifier et exécuter le code