Analiza wymiarowości i przetwarzanie wstępne
W tym ćwiczeniu masz do dyspozycji lem_corpus zawierający przetworzone wersje tagline'ów filmowych z poprzedniego ćwiczenia. Innymi słowy, tagline'y zostały zamienione na małe litery, zlemmatyzowane, a stopwordy usunięte.
Twoim zadaniem jest wygenerowanie reprezentacji bag-of-words bow_lem_matrix dla tych zlemmatyzowanych tagline'ów oraz porównanie jej kształtu z kształtem bow_matrix uzyskanej w poprzednim ćwiczeniu. Pierwszych pięć zlemmatyzowanych tagline'ów z lem_corpus zostało wyświetlonych w konsoli, abyś mógł je przejrzeć.
To ćwiczenie jest częścią kursu
Inżynieria cech dla NLP w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj klasę
CountVectorizerz bibliotekisklearn. - Utwórz obiekt
CountVectorizer. Nadaj mu nazwęvectorizer. - Korzystając z metody
fit_transform(), wygenerujbow_lem_matrixdlalem_corpus.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)
# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)