Kom igångKom igång gratis

BoW-vektorer för filmrecensioner

I den här övningen har du fått två pandas-serier, X_train och X_test, som innehåller filmrecensioner. De representerar tränings- respektive testdata. Din uppgift är att förbehandla recensionerna och generera BoW-vektorer för dessa två uppsättningar med hjälp av CountVectorizer.

När vi väl har genererat BoW-vektormatriserna X_train_bow och X_test_bow är vi väl förberedda för att applicera en maskininlärningsmodell och genomföra sentimentanalys.

Den här övningen är en del av kursen

Funktionsutveckling för NLP i Python

Visa kurs

Övningsinstruktioner

  • Importera CountVectorizer från biblioteket sklearn.
  • Skapa ett CountVectorizer-objekt med namnet vectorizer. Se till att alla ord konverteras till gemener och att stoppord för english tas bort.
  • Använd X_train för att anpassa vectorizer och transformera sedan X_train för att generera uppsättningen BoW-vektorer X_train_bow.
  • Transformera X_test med vectorizer för att generera uppsättningen BoW-vektorer X_test_bow.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)

# Fit and transform X_train
X_train_bow = vectorizer.____(____)

# Transform X_test
X_test_bow = vectorizer.____(____)

# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)
Redigera och kör kod