Ваш перший BOW
Bag-of-words — це підхід для перетворення тексту на числову форму.
У цій вправі ви застосуєте BOW до списку annak, перш ніж перейти до більшого набору даних у наступній вправі.
Ваше завдання — попрацювати з цим списком і застосувати BOW за допомогою CountVectorizer(). Це перший крок до розуміння тональності тексту. Звертайте увагу на слова, що можуть виражати сильну емоційну оцінку.
Пам'ятайте, що результат CountVectorizer() — це розріджена матриця, яка зберігає лише ненульові елементи. Щоб подивитися фактичний вміст цієї матриці, перетворіть її на щільний масив методом .toarray().
Зверніть увагу: у цьому випадку не потрібно задавати аргумент max_features, адже текст короткий.
Ця вправа є частиною курсу
Аналіз тональності в Python
Інструкції до вправи
- Імпортуйте функцію векторизатора підрахунків із
sklearn.feature_extraction.text. - Побудуйте й навчіть векторизатор на невеликому наборі даних.
- Створіть представлення BOW з назвою
anna_bow, викликавши методtransform(). - Виведіть результат BOW як щільний масив.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import the required function
____
annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']
# Build the vectorizer and fit it
anna_vect = ____
____.____(annak)
# Create the bow representation
anna_bow = anna_vect.____(annak)
# Print the bag-of-words result
print(anna_bow.toarray())