BOW na podstawie recenzji produktów
Przećwiczyłeś już metodę BOW na małym zbiorze danych. Teraz zastosuj ją do próbki recenzji produktów Amazon. Dane zostały już zaimportowane i są dostępne pod nazwą reviews. Zbiór zawiera dwie kolumny. Pierwsza to score – przyjmuje wartość 0 dla recenzji negatywnej i 1 dla pozytywnej. Druga kolumna to review – zawiera tekst recenzji napisanej przez klienta. Możesz swobodnie przejrzeć dane w konsoli IPython.
Twoim zadaniem jest zbudowanie słownika BOW na podstawie kolumny review.
Pamiętaj, że możesz wywołać metodę .get_feature_names() na wektoryzatorze, aby uzyskać listę wszystkich elementów słownika.
To ćwiczenie jest częścią kursu
Analiza sentymentu w Pythonie
Instrukcje do ćwiczenia
- Utwórz obiekt CountVectorizer, podając maksymalną liczbę cech.
- Dopasuj wektoryzator.
- Przekształć dopasowany wektoryzator.
- Utwórz DataFrame, przekształcając rzadką macierz w gęstą tablicę, i upewnij się, że nazwy kolumn są poprawnie określone.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify max features
vect = ____(____=100)
# Fit the vectorizer
vect.____(reviews.review)
# Transform the review column
X_review = vect.____(reviews.review)
# Create the bow representation
X_df=pd.DataFrame(X_review._____, columns=___.____)
print(X_df.head())