ПочатиПочніть безкоштовно

Ваш перший BOW

Bag-of-words — це підхід для перетворення тексту на числову форму.

У цій вправі ви застосуєте BOW до списку annak, перш ніж перейти до більшого набору даних у наступній вправі.

Ваше завдання — попрацювати з цим списком і застосувати BOW за допомогою CountVectorizer(). Це перший крок до розуміння тональності тексту. Звертайте увагу на слова, що можуть виражати сильну емоційну оцінку.

Пам'ятайте, що результат CountVectorizer() — це розріджена матриця, яка зберігає лише ненульові елементи. Щоб подивитися фактичний вміст цієї матриці, перетворіть її на щільний масив методом .toarray().

Зверніть увагу: у цьому випадку не потрібно задавати аргумент max_features, адже текст короткий.

Ця вправа є частиною курсу

Аналіз тональності в Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте функцію векторизатора підрахунків із sklearn.feature_extraction.text.
  • Побудуйте й навчіть векторизатор на невеликому наборі даних.
  • Створіть представлення BOW з назвою anna_bow, викликавши метод transform().
  • Виведіть результат BOW як щільний масив.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import the required function
____

annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']

# Build the vectorizer and fit it
anna_vect = ____
____.____(annak)

# Create the bow representation
anna_bow = anna_vect.____(annak)

# Print the bag-of-words result 
print(anna_bow.toarray())
Редагувати та запускати код