Analysera dimensionalitet och förbehandling
I den här övningen har du tillgång till ett lem_corpus som innehåller förbehandlade versioner av filmtaglinjerna från föregående övning. Det innebär att taglinjer har konverterats till gemener, lemmatiserats och att stoppord har tagits bort.
Din uppgift är att generera bag-of-words-representationen bow_lem_matrix för dessa lemmatiserade taglinjer och jämföra dess form med formen hos bow_matrix från föregående övning. De fem första lemmatiserade taglinjerna i lem_corpus har skrivits ut i konsolen så att du kan granska dem.
Den här övningen är en del av kursen
Funktionsutveckling för NLP i Python
Övningsinstruktioner
- Importera klassen
CountVectorizerfrånsklearn. - Skapa ett
CountVectorizer-objekt och ge det namnetvectorizer. - Använd
fit_transform()för att genererabow_lem_matrixförlem_corpus.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)
# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)