Kom igångKom igång gratis

Analysera dimensionalitet och förbehandling

I den här övningen har du tillgång till ett lem_corpus som innehåller förbehandlade versioner av filmtaglinjerna från föregående övning. Det innebär att taglinjer har konverterats till gemener, lemmatiserats och att stoppord har tagits bort.

Din uppgift är att generera bag-of-words-representationen bow_lem_matrix för dessa lemmatiserade taglinjer och jämföra dess form med formen hos bow_matrix från föregående övning. De fem första lemmatiserade taglinjerna i lem_corpus har skrivits ut i konsolen så att du kan granska dem.

Den här övningen är en del av kursen

Funktionsutveckling för NLP i Python

Visa kurs

Övningsinstruktioner

  • Importera klassen CountVectorizer från sklearn.
  • Skapa ett CountVectorizer-objekt och ge det namnet vectorizer.
  • Använd fit_transform() för att generera bow_lem_matrix för lem_corpus.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)

# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)
Redigera och kör kod