Tfidf et sac de mots sur les mêmes données
Dans cet exercice, vous allez transformer la colonne review des reviews de produits Amazon en utilisant à la fois un sac de mots (bag-of-words) et une transformation tfidf.
Construisez les deux vectoriseurs en ne précisant que le nombre maximal de caractéristiques égal à 100. Créez des DataFrame après la transformation et affichez les 5 premières lignes de chacun.
Soyez vigilant quant à la façon de définir le nombre maximal de caractéristiques dans le vocabulaire. Un vocabulaire trop grand peut entraîner l'interruption de votre séance.
Cette activité fait partie du cours
Analyse de sentiment en Python
Instructions de l’exercice
- Importez les vectoriseurs BOW et Tfidf.
- Créez et ajustez un vectoriseur BOW et un vectoriseur Tfidf à partir de la colonne
reviewet limitez le nombre de caractéristiques créées à 100. - Créez des DataFrame à partir des représentations vectorielles transformées.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import the required packages
____
# Build a BOW and tfidf vectorizers from the review column and with max of 100 features
vect1 = ____(____=100).____(____.____)
vect2 = ____(____=100).____(____.____)
# Transform the vectorizers
X1 = vect1.transform(reviews.review)
X2 = vect2.transform(reviews.review)
# Create DataFrames from the vectorizers
X_df1 = pd.DataFrame(X1.____, columns=____.____)
X_df2 = pd.DataFrame(X2.____, columns=____.____)
print('Top 5 rows using BOW: \n', X_df1.head())
print('Top 5 rows using tfidf: \n', X_df2.head())