Модель «мешка слов» для слоганов к фильмам
В этом упражнении вам предоставлен corpus, содержащий более 7000 слоганов к фильмам. Ваша задача — сформировать представление «мешка слов» bow_matrix для этих слоганов. В данном упражнении мы пропустим этап предобработки текста и сразу перейдём к построению bow_matrix.
Мы также изучим форму полученной матрицы bow_matrix. Первые пять слоганов из corpus выведены в консоль для ознакомления.
Это упражнение является частью курса
Конструирование признаков для NLP на Python
Инструкции к упражнению
- Импортируйте класс
CountVectorizerизsklearn. - Создайте экземпляр объекта
CountVectorizerи присвойте ему имяvectorizer. - С помощью метода
fit_transform()постройтеbow_matrixдляcorpus.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Print the shape of bow_matrix
print(bow_matrix.shape)