Анализ размерности и предобработка данных
В этом упражнении вам предоставлен lem_corpus — предобработанные версии слоганов к фильмам из предыдущего упражнения. Другими словами, слоганы приведены к нижнему регистру, лемматизированы, а стоп-слова удалены.
Ваша задача — сформировать представление в виде мешка слов bow_lem_matrix для этих лемматизированных слоганов и сравнить его форму с формой bow_matrix, полученной в предыдущем упражнении. Первые пять лемматизированных слоганов из lem_corpus уже выведены в консоль для вашего ознакомления.
Это упражнение является частью курса
Конструирование признаков для NLP на Python
Инструкции к упражнению
- Импортируйте класс
CountVectorizerизsklearn. - Создайте экземпляр объекта
CountVectorizerи назовите егоvectorizer. - С помощью
fit_transform()сформируйтеbow_lem_matrixдляlem_corpus.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)
# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)