Vecteurs BoW pour des critiques de films
Dans cet exercice, vous disposez de deux objets Series de pandas, X_train et X_test, qui contiennent des critiques de films. Ils représentent respectivement les données d'entraînement et de test. Votre tâche est de prétraiter les critiques et de générer des vecteurs BoW pour ces deux ensembles à l'aide de CountVectorizer.
Une fois les matrices de vecteurs BoW X_train_bow et X_test_bow générées, nous serons très bien placés pour y appliquer un modèle de Machine Learning et réaliser une analyse de sentiment.
Cette activité fait partie du cours
Ingénierie des caractéristiques pour le NLP en Python
Instructions de l’exercice
- Importez
CountVectorizerde la bibliothèquesklearn. - Instanciez un objet
CountVectorizernommévectorizer. Assurez-vous que tous les mots sont convertis en minuscules et que les stopwordsenglishsont retirés. - En utilisant
X_train, ajustezvectorizer, puis utilisez-le pour transformerX_trainafin de générer l'ensemble de vecteurs BoWX_train_bow. - Transformez
X_testavecvectorizerpour générer l'ensemble de vecteurs BoWX_test_bow.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)
# Fit and transform X_train
X_train_bow = vectorizer.____(____)
# Transform X_test
X_test_bow = vectorizer.____(____)
# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)