НачатьНачать бесплатно

Модель «мешка слов» для слоганов к фильмам

В этом упражнении вам предоставлен corpus, содержащий более 7000 слоганов к фильмам. Ваша задача — сформировать представление «мешка слов» bow_matrix для этих слоганов. В данном упражнении мы пропустим этап предобработки текста и сразу перейдём к построению bow_matrix.

Мы также изучим форму полученной матрицы bow_matrix. Первые пять слоганов из corpus выведены в консоль для ознакомления.

Это упражнение является частью курса

Конструирование признаков для NLP на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте класс CountVectorizer из sklearn.
  • Создайте экземпляр объекта CountVectorizer и присвойте ему имя vectorizer.
  • С помощью метода fit_transform() постройте bow_matrix для corpus.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Print the shape of bow_matrix
print(bow_matrix.shape)
Редактировать и запускать код