ПочатиПочніть безкоштовно

Модель BoW для слоганів фільмів

У цій вправі вам надано corpus із понад 7000 слоганів фільмів. Ваше завдання — згенерувати представлення «мішок слів» — bow_matrix — для цих слоганів. У цій вправі ми пропустимо крок попередньої обробки тексту та одразу згенеруємо bow_matrix.

Ми також дослідимо розмірність отриманої bow_matrix. Перші п'ять слоганів у corpus уже виведено в консоль для ознайомлення.

Ця вправа є частиною курсу

Інженерія ознак для NLP у Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте клас CountVectorizer з sklearn.
  • Створіть об'єкт CountVectorizer. Назвіть його vectorizer.
  • Використовуючи fit_transform(), згенеруйте bow_matrix для corpus.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Print the shape of bow_matrix
print(bow_matrix.shape)
Редагувати та запускати код