Spécifier la longueur des séquences de jetons avec BOW
Comme on l'a vu dans la vidéo, en précisant différentes longueurs de jetons — ce que nous appelons des n-grammes — on capte mieux le contexte, ce qui peut être très important.
Dans cet exercice, vous travaillerez avec un échantillon d'avis de produits Amazon. Votre tâche consiste à construire un vocabulaire BOW à partir de la colonne review et à préciser la longueur des séquences de jetons.
Cette activité fait partie du cours
Analyse de sentiment en Python
Instructions de l’exercice
- Construisez le vectoriseur en précisant que la longueur des séquences de jetons doit être des uni-grammes et des bi-grammes.
- Ajustez (fit) le vectoriseur.
- Transformez avec le vectoriseur ajusté.
- Dans le DataFrame, assurez-vous d'indiquer correctement les noms de colonnes.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)
# Transform the review column
X_review = vect.____(reviews.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())