НачатьНачать бесплатно

Ваш первый мешок слов

Мешок слов (bag-of-words) — это подход к преобразованию текста в числовой формат.

В этом упражнении вы применяете метод мешка слов к списку annak, прежде чем перейти к работе с более крупным набором данных в следующем упражнении.

Ваша задача — обработать этот список и применить BOW с помощью CountVectorizer(). Это преобразование станет первым шагом к анализу тональности текста. Обратите внимание на слова, которые могут нести выраженную эмоциональную окраску.

Учтите, что CountVectorizer() возвращает разреженную матрицу, в которой хранятся только ненулевые значения. Чтобы увидеть содержимое матрицы, преобразуйте её в плотный массив с помощью метода .toarray().

Обратите внимание: в данном случае задавать аргумент max_features не нужно, поскольку текст короткий.

Это упражнение является частью курса

Анализ тональности текста на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте функцию подсчёта векторов из sklearn.feature_extraction.text.
  • Создайте векторизатор и обучите его на небольшом наборе данных.
  • Сформируйте представление в виде мешка слов с именем anna_bow, вызвав метод transform().
  • Выведите результат в виде плотного массива.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the required function
____

annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']

# Build the vectorizer and fit it
anna_vect = ____
____.____(annak)

# Create the bow representation
anna_bow = anna_vect.____(annak)

# Print the bag-of-words result 
print(anna_bow.toarray())
Редактировать и запускать код