Zacznij terazZacznij za darmo

BOW na podstawie recenzji produktów

Przećwiczyłeś już metodę BOW na małym zbiorze danych. Teraz zastosuj ją do próbki recenzji produktów Amazon. Dane zostały już zaimportowane i są dostępne pod nazwą reviews. Zbiór zawiera dwie kolumny. Pierwsza to score – przyjmuje wartość 0 dla recenzji negatywnej i 1 dla pozytywnej. Druga kolumna to review – zawiera tekst recenzji napisanej przez klienta. Możesz swobodnie przejrzeć dane w konsoli IPython.

Twoim zadaniem jest zbudowanie słownika BOW na podstawie kolumny review.

Pamiętaj, że możesz wywołać metodę .get_feature_names() na wektoryzatorze, aby uzyskać listę wszystkich elementów słownika.

To ćwiczenie jest częścią kursu

Analiza sentymentu w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz obiekt CountVectorizer, podając maksymalną liczbę cech.
  • Dopasuj wektoryzator.
  • Przekształć dopasowany wektoryzator.
  • Utwórz DataFrame, przekształcając rzadką macierz w gęstą tablicę, i upewnij się, że nazwy kolumn są poprawnie określone.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify max features 
vect = ____(____=100)
# Fit the vectorizer
vect.____(reviews.review)

# Transform the review column
X_review = vect.____(reviews.review)

# Create the bow representation
X_df=pd.DataFrame(X_review._____, columns=___.____)
print(X_df.head())
Edytuj i uruchom kod