Zacznij terazZacznij za darmo

BOW z n-gramami i ograniczonym słownikiem

W tym ćwiczeniu ponownie zbudujesz model bag-of-words, korzystając ze zbioru danych reviews zawierającego recenzje produktów Amazon. Twoim głównym zadaniem będzie ograniczenie rozmiaru słownika oraz określenie długości sekwencji tokenów.

To ćwiczenie jest częścią kursu

Analiza sentymentu w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj wektoryzator z biblioteki sklearn.
  • Zbuduj wektoryzator i określ następujące parametry: rozmiar słownika powinien być ograniczony do 1000, uwzględniaj tylko bigramy i ignoruj terminy, które pojawiają się w więcej niż 500 dokumentach.
  • Dopasuj wektoryzator do kolumny review.
  • Utwórz obiekt DataFrame z reprezentacji BOW.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

#Import the vectorizer
from sklearn.____.____ import ____

# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)

# Transform the review
X_review = vect.transform(reviews.review)

# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())
Edytuj i uruchom kod