Zacznij terazZacznij za darmo

Określanie długości sekwencji tokenów z BOW

W materiale wideo zobaczyłeś, że określając różne długości tokenów – tak zwane n-gramy – możemy lepiej uchwycić kontekst, co bywa bardzo istotne.

W tym ćwiczeniu pracujesz z próbką recenzji produktów Amazon. Twoim zadaniem jest zbudowanie słownika BOW na podstawie kolumny review i określenie długości sekwencji tokenów.

To ćwiczenie jest częścią kursu

Analiza sentymentu w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zbuduj wektoryzator, określając długość sekwencji tokenów jako unigramy i bigramy.
  • Dopasuj wektoryzator.
  • Przekształć dopasowany wektoryzator.
  • Upewnij się, że w ramce danych poprawnie podano nazwy kolumn.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)

# Transform the review column
X_review = vect.____(reviews.review)

# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())
Edytuj i uruchom kod