Określanie długości sekwencji tokenów z BOW
W materiale wideo zobaczyłeś, że określając różne długości tokenów – tak zwane n-gramy – możemy lepiej uchwycić kontekst, co bywa bardzo istotne.
W tym ćwiczeniu pracujesz z próbką recenzji produktów Amazon. Twoim zadaniem jest zbudowanie słownika BOW na podstawie kolumny review i określenie długości sekwencji tokenów.
To ćwiczenie jest częścią kursu
Analiza sentymentu w Pythonie
Instrukcje do ćwiczenia
- Zbuduj wektoryzator, określając długość sekwencji tokenów jako unigramy i bigramy.
- Dopasuj wektoryzator.
- Przekształć dopasowany wektoryzator.
- Upewnij się, że w ramce danych poprawnie podano nazwy kolumn.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)
# Transform the review column
X_review = vect.____(reviews.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())