BoW-modell för filmtaglines
I den här övningen har du tillgång till ett corpus med mer än 7 000 filmtaglines. Din uppgift är att generera bag-of-words-representationen bow_matrix för dessa taglines. Vi hoppar över förbearbetningssteget och genererar bow_matrix direkt.
Vi undersöker också formen på den resulterande bow_matrix. De fem första taglines i corpus har skrivits ut i konsolen så att du kan titta på dem.
Den här övningen är en del av kursen
Funktionsutveckling för NLP i Python
Övningsinstruktioner
- Importera klassen
CountVectorizerfrånsklearn. - Skapa ett
CountVectorizer-objekt och ge det namnetvectorizer. - Använd
fit_transform()för att genererabow_matrixförcorpus.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Print the shape of bow_matrix
print(bow_matrix.shape)