Začněte nyníZačněte zdarma

Analýza dimenzionality a předzpracování dat

V tomto cvičení máš k dispozici lem_corpus, který obsahuje předzpracované verze filmových taglinů z předchozího cvičení. Tagliny byly převedeny na malá písmena, lematizovány a odstraněna z nich byla stopslova.

Tvým úkolem je vytvořit reprezentaci bag of words bow_lem_matrix pro tyto lematizované tagliny a porovnat její tvar s tvarem bow_matrix z předchozího cvičení. Prvních pět lematizovaných taglinů z lem_corpus ti bylo vypsáno do konzole.

Toto cvičení je součástí kurzu

Feature Engineering for NLP in Python

Zobrazit kurz

Pokyny k cvičení

  • Importuj třídu CountVectorizer z sklearn.
  • Vytvoř instanci objektu CountVectorizer a pojmenuj ji vectorizer.
  • Pomocí fit_transform() vygeneruj bow_lem_matrix pro lem_corpus.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)

# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)
Upravit a spustit kód