Určení délky sekvence tokenů pomocí BOW
Ve videu jsme si ukázali, že zadáním různých délek sekvencí tokenů – tzv. n-gramů – dokážeme lépe zachytit kontext, což může být velmi důležité.
V tomto cvičení budeš pracovat se vzorkem recenzí produktů z Amazonu. Tvým úkolem je sestavit slovník BOW pomocí sloupce review a určit délku sekvence tokenů.
Toto cvičení je součástí kurzu
Sentiment Analysis v Pythonu
Pokyny k cvičení
- Sestav vektorizér a nastav délku sekvence tokenů na unigramy a bigramy.
- Natrénuj vektorizér.
- Transformuj natrénovaný vektorizér.
- V DataFrame správně zadej názvy sloupců.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)
# Transform the review column
X_review = vect.____(reviews.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())