Model BoW dla tagline'ów filmowych
W tym ćwiczeniu masz do dyspozycji corpus zawierający ponad 7000 tagline'ów filmowych. Twoim zadaniem jest wygenerowanie reprezentacji bag of words — bow_matrix — dla tych tagline'ów. Na tym etapie pomijamy krok wstępnego przetwarzania tekstu i generujemy bow_matrix bezpośrednio.
Sprawdzimy też kształt wynikowej macierzy bow_matrix. Pierwsze pięć tagline'ów z corpus zostało wyświetlonych w konsoli — możesz je przejrzeć.
To ćwiczenie jest częścią kursu
Inżynieria cech dla NLP w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj klasę
CountVectorizerz bibliotekisklearn. - Utwórz obiekt
CountVectorizeri nadaj mu nazwęvectorizer. - Korzystając z
fit_transform(), wygenerujbow_matrixdlacorpus.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Print the shape of bow_matrix
print(bow_matrix.shape)