Začněte nyníZačněte zdarma

Určení délky sekvence tokenů pomocí BOW

Ve videu jsme si ukázali, že zadáním různých délek sekvencí tokenů – tzv. n-gramů – dokážeme lépe zachytit kontext, což může být velmi důležité.

V tomto cvičení budeš pracovat se vzorkem recenzí produktů z Amazonu. Tvým úkolem je sestavit slovník BOW pomocí sloupce review a určit délku sekvence tokenů.

Toto cvičení je součástí kurzu

Sentiment Analysis v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Sestav vektorizér a nastav délku sekvence tokenů na unigramy a bigramy.
  • Natrénuj vektorizér.
  • Transformuj natrénovaný vektorizér.
  • V DataFrame správně zadej názvy sloupců.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)

# Transform the review column
X_review = vect.____(reviews.review)

# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())
Upravit a spustit kód