ПочатиПочніть безкоштовно

Аналіз розмірності та попередньої обробки

У цій вправі вам надано lem_corpus, який містить попередньо оброблені варіанти слоганів до фільмів із попередньої вправи. Тобто слогани було перетворено на нижній регістр і лематизовано, а стоп-слова видалено.

Ваше завдання — згенерувати представлення «мішка слів» bow_lem_matrix для цих лематизованих слоганів і порівняти його форму з bow_matrix, отриманою в попередній вправі. Перші п'ять лематизованих слоганів у lem_corpus виведено в консоль для ознайомлення.

Ця вправа є частиною курсу

Інженерія ознак для NLP у Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте клас CountVectorizer з sklearn.
  • Створіть об'єкт CountVectorizer. Назвіть його vectorizer.
  • Використовуючи fit_transform(), згенеруйте bow_lem_matrix для lem_corpus.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)

# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)
Редагувати та запускати код