Kom igångKom igång gratis

BoW-modell för filmtaglines

I den här övningen har du tillgång till ett corpus med mer än 7 000 filmtaglines. Din uppgift är att generera bag-of-words-representationen bow_matrix för dessa taglines. Vi hoppar över förbearbetningssteget och genererar bow_matrix direkt.

Vi undersöker också formen på den resulterande bow_matrix. De fem första taglines i corpus har skrivits ut i konsolen så att du kan titta på dem.

Den här övningen är en del av kursen

Funktionsutveckling för NLP i Python

Visa kurs

Övningsinstruktioner

  • Importera klassen CountVectorizer från sklearn.
  • Skapa ett CountVectorizer-objekt och ge det namnet vectorizer.
  • Använd fit_transform() för att generera bow_matrix för corpus.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Print the shape of bow_matrix
print(bow_matrix.shape)
Redigera och kör kod