Étape 2 : Créer un vectoriseur
Dans cet exercice, vous devez construire une transformation TfIDf de la colonne review dans l'ensemble de données reviews. Vous devez préciser les n-grammes, les mots vides (stop words), le motif des jetons (tokens) et la taille du vocabulaire.
C'est la dernière étape avant d'entraîner un classificateur pour prédire le sentiment d'une évaluation.
Assurez-vous d'indiquer correctement le nombre maximal de caractéristiques, car un vocabulaire trop grand pourrait déconnecter votre session.
Cette activité fait partie du cours
Analyse de sentiment en Python
Instructions de l’exercice
- Importez le vectoriseur Tfidf et la liste par défaut des mots vides en anglais.
- Créez le vectoriseur Tfidf en précisant — dans cet ordre — les arguments suivants : utilisez comme mots vides la liste par défaut en anglais ; utilisez comme n-grammes les uni- et bi-grammes ; le nombre maximal de caractéristiques doit être 200 ; ne captez que les mots à l'aide du motif indiqué.
- Créez un DataFrame à l'aide du vectoriseur Tfidf.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import the TfidfVectorizer and default list of English stop words
from sklearn.feature_extraction.text import ____, ____
# Build the vectorizer
vect = ____(____=____, ____=(1, 2), ____=200, ____=r'\b[^\d\W][^\d\W]+\b').fit(reviews.review)
# Create sparse matrix from the vectorizer
X = vect.transform(reviews.review)
# Create a DataFrame
reviews_transformed = pd.DataFrame(X.____, columns=vect.____)
print('Top 5 rows of the DataFrame: \n', reviews_transformed.head())