BoW-vektorer för filmrecensioner
I den här övningen har du fått två pandas-serier, X_train och X_test, som innehåller filmrecensioner. De representerar tränings- respektive testdata. Din uppgift är att förbehandla recensionerna och generera BoW-vektorer för dessa två uppsättningar med hjälp av CountVectorizer.
När vi väl har genererat BoW-vektormatriserna X_train_bow och X_test_bow är vi väl förberedda för att applicera en maskininlärningsmodell och genomföra sentimentanalys.
Den här övningen är en del av kursen
Funktionsutveckling för NLP i Python
Övningsinstruktioner
- Importera
CountVectorizerfrån biblioteketsklearn. - Skapa ett
CountVectorizer-objekt med namnetvectorizer. Se till att alla ord konverteras till gemener och att stoppord förenglishtas bort. - Använd
X_trainför att anpassavectorizeroch transformera sedanX_trainför att generera uppsättningen BoW-vektorerX_train_bow. - Transformera
X_testmedvectorizerför att generera uppsättningen BoW-vektorerX_test_bow.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)
# Fit and transform X_train
X_train_bow = vectorizer.____(____)
# Transform X_test
X_test_bow = vectorizer.____(____)
# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)