НачатьНачать бесплатно

Анализ размерности и предобработка данных

В этом упражнении вам предоставлен lem_corpus — предобработанные версии слоганов к фильмам из предыдущего упражнения. Другими словами, слоганы приведены к нижнему регистру, лемматизированы, а стоп-слова удалены.

Ваша задача — сформировать представление в виде мешка слов bow_lem_matrix для этих лемматизированных слоганов и сравнить его форму с формой bow_matrix, полученной в предыдущем упражнении. Первые пять лемматизированных слоганов из lem_corpus уже выведены в консоль для вашего ознакомления.

Это упражнение является частью курса

Конструирование признаков для NLP на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте класс CountVectorizer из sklearn.
  • Создайте экземпляр объекта CountVectorizer и назовите его vectorizer.
  • С помощью fit_transform() сформируйте bow_lem_matrix для lem_corpus.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)

# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)
Редактировать и запускать код