CommencezCommencez gratuitement

Taille du vocabulaire des critiques de films

Dans cet exercice, vous allez pratiquer différentes façons de limiter la taille du vocabulaire à l'aide d'un échantillon du jeu de données de critiques movies. La première colonne est review (de type object), et la deuxième est label, où 0 correspond à une critique négative et 1 à une critique positive.

Les trois méthodes que vous utiliserez convertiront la colonne de texte en de nouvelles colonnes numériques, qui indiqueront le nombre d'occurrences d'un mot ou d'une expression dans chaque critique. Chaque méthode mènera à créer un nombre différent de nouvelles caractéristiques.

Cette activité fait partie du cours

Analyse de sentiment en Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify size of vocabulary and fit
vect = CountVectorizer(____=____)
vect.fit(movies.review)

# Transform the review column
X_review = vect.transform(movies.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())
Modifier et exécuter le code