1. Learn
  2. /
  3. Курси
  4. /
  5. Аналіз тональності в Python

Connected

Вправа

Ваш перший BOW

Bag-of-words — це підхід для перетворення тексту на числову форму.

У цій вправі ви застосуєте BOW до списку annak, перш ніж перейти до більшого набору даних у наступній вправі.

Ваше завдання — попрацювати з цим списком і застосувати BOW за допомогою CountVectorizer(). Це перший крок до розуміння тональності тексту. Звертайте увагу на слова, що можуть виражати сильну емоційну оцінку.

Пам'ятайте, що результат CountVectorizer() — це розріджена матриця, яка зберігає лише ненульові елементи. Щоб подивитися фактичний вміст цієї матриці, перетворіть її на щільний масив методом .toarray().

Зверніть увагу: у цьому випадку не потрібно задавати аргумент max_features, адже текст короткий.

Інструкції

100 XP
  • Імпортуйте функцію векторизатора підрахунків із sklearn.feature_extraction.text.
  • Побудуйте й навчіть векторизатор на невеликому наборі даних.
  • Створіть представлення BOW з назвою anna_bow, викликавши метод transform().
  • Виведіть результат BOW як щільний масив.