Taille du vocabulaire des critiques de films
Dans cet exercice, vous allez pratiquer différentes façons de limiter la taille du vocabulaire à l'aide d'un échantillon du jeu de données de critiques movies. La première colonne est review (de type object), et la deuxième est label, où 0 correspond à une critique négative et 1 à une critique positive.
Les trois méthodes que vous utiliserez convertiront la colonne de texte en de nouvelles colonnes numériques, qui indiqueront le nombre d'occurrences d'un mot ou d'une expression dans chaque critique. Chaque méthode mènera à créer un nombre différent de nouvelles caractéristiques.
Cette activité fait partie du cours
Analyse de sentiment en Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify size of vocabulary and fit
vect = CountVectorizer(____=____)
vect.fit(movies.review)
# Transform the review column
X_review = vect.transform(movies.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())