Ваш первый мешок слов
Мешок слов (bag-of-words) — это подход к преобразованию текста в числовой формат.
В этом упражнении вы применяете метод мешка слов к списку annak, прежде чем перейти к работе с более крупным набором данных в следующем упражнении.
Ваша задача — обработать этот список и применить BOW с помощью CountVectorizer(). Это преобразование станет первым шагом к анализу тональности текста. Обратите внимание на слова, которые могут нести выраженную эмоциональную окраску.
Учтите, что CountVectorizer() возвращает разреженную матрицу, в которой хранятся только ненулевые значения. Чтобы увидеть содержимое матрицы, преобразуйте её в плотный массив с помощью метода .toarray().
Обратите внимание: в данном случае задавать аргумент max_features не нужно, поскольку текст короткий.
Это упражнение является частью курса
Анализ тональности текста на Python
Инструкции к упражнению
- Импортируйте функцию подсчёта векторов из
sklearn.feature_extraction.text. - Создайте векторизатор и обучите его на небольшом наборе данных.
- Сформируйте представление в виде мешка слов с именем
anna_bow, вызвав методtransform(). - Выведите результат в виде плотного массива.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the required function
____
annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']
# Build the vectorizer and fit it
anna_vect = ____
____.____(annak)
# Create the bow representation
anna_bow = anna_vect.____(annak)
# Print the bag-of-words result
print(anna_bow.toarray())