Twój pierwszy BOW
Worek słów (bag-of-words) to metoda przekształcania tekstu na postać numeryczną.
W tym ćwiczeniu zastosujesz BOW do listy annak, zanim przejdziesz do większego zbioru danych w kolejnym ćwiczeniu.
Twoim zadaniem jest praca z tą listą i zastosowanie BOW przy użyciu CountVectorizer(). To przekształcenie to pierwszy krok w kierunku analizy sentymentu tekstu. Zwróć uwagę na słowa, które mogą nieść silny ładunek emocjonalny.
Pamiętaj, że wynikiem działania CountVectorizer() jest rzadka macierz (sparse matrix), która przechowuje tylko wartości niezerowe. Aby podejrzeć rzeczywistą zawartość tej macierzy, konwertujemy ją na gęstą tablicę za pomocą metody .toarray().
W tym przypadku nie musisz podawać argumentu max_features, ponieważ tekst jest krótki.
To ćwiczenie jest częścią kursu
Analiza sentymentu w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj funkcję wektoryzatora zliczającego z
sklearn.feature_extraction.text. - Zbuduj wektoryzator i dopasuj go do małego zbioru danych.
- Utwórz reprezentację BOW o nazwie
anna_bow, wywołując metodętransform(). - Wyświetl wynik BOW jako gęstą tablicę.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the required function
____
annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']
# Build the vectorizer and fit it
anna_vect = ____
____.____(annak)
# Create the bow representation
anna_bow = anna_vect.____(annak)
# Print the bag-of-words result
print(anna_bow.toarray())