Analýza dimenzionality a předzpracování dat
V tomto cvičení máš k dispozici lem_corpus, který obsahuje předzpracované verze filmových taglinů z předchozího cvičení. Tagliny byly převedeny na malá písmena, lematizovány a odstraněna z nich byla stopslova.
Tvým úkolem je vytvořit reprezentaci bag of words bow_lem_matrix pro tyto lematizované tagliny a porovnat její tvar s tvarem bow_matrix z předchozího cvičení. Prvních pět lematizovaných taglinů z lem_corpus ti bylo vypsáno do konzole.
Toto cvičení je součástí kurzu
Feature Engineering for NLP in Python
Pokyny k cvičení
- Importuj třídu
CountVectorizerzsklearn. - Vytvoř instanci objektu
CountVectorizera pojmenuj jivectorizer. - Pomocí
fit_transform()vygenerujbow_lem_matrixprolem_corpus.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)
# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)