Модель BoW для слоганів фільмів
У цій вправі вам надано corpus із понад 7000 слоганів фільмів. Ваше завдання — згенерувати представлення «мішок слів» — bow_matrix — для цих слоганів. У цій вправі ми пропустимо крок попередньої обробки тексту та одразу згенеруємо bow_matrix.
Ми також дослідимо розмірність отриманої bow_matrix. Перші п'ять слоганів у corpus уже виведено в консоль для ознайомлення.
Ця вправа є частиною курсу
Інженерія ознак для NLP у Python
Інструкції до вправи
- Імпортуйте клас
CountVectorizerзsklearn. - Створіть об'єкт
CountVectorizer. Назвіть йогоvectorizer. - Використовуючи
fit_transform(), згенеруйтеbow_matrixдляcorpus.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Print the shape of bow_matrix
print(bow_matrix.shape)