Аналіз розмірності та попередньої обробки
У цій вправі вам надано lem_corpus, який містить попередньо оброблені варіанти слоганів до фільмів із попередньої вправи. Тобто слогани було перетворено на нижній регістр і лематизовано, а стоп-слова видалено.
Ваше завдання — згенерувати представлення «мішка слів» bow_lem_matrix для цих лематизованих слоганів і порівняти його форму з bow_matrix, отриманою в попередній вправі. Перші п'ять лематизованих слоганів у lem_corpus виведено в консоль для ознайомлення.
Ця вправа є частиною курсу
Інженерія ознак для NLP у Python
Інструкції до вправи
- Імпортуйте клас
CountVectorizerзsklearn. - Створіть об'єкт
CountVectorizer. Назвіть йогоvectorizer. - Використовуючи
fit_transform(), згенеруйтеbow_lem_matrixдляlem_corpus.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)
# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)