BOW z n-gramami i ograniczonym słownikiem
W tym ćwiczeniu ponownie zbudujesz model bag-of-words, korzystając ze zbioru danych reviews zawierającego recenzje produktów Amazon. Twoim głównym zadaniem będzie ograniczenie rozmiaru słownika oraz określenie długości sekwencji tokenów.
To ćwiczenie jest częścią kursu
Analiza sentymentu w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj wektoryzator z biblioteki
sklearn. - Zbuduj wektoryzator i określ następujące parametry: rozmiar słownika powinien być ograniczony do 1000, uwzględniaj tylko bigramy i ignoruj terminy, które pojawiają się w więcej niż 500 dokumentach.
- Dopasuj wektoryzator do kolumny
review. - Utwórz obiekt DataFrame z reprezentacji BOW.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
#Import the vectorizer
from sklearn.____.____ import ____
# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)
# Transform the review
X_review = vect.transform(reviews.review)
# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())