Začněte nyníZačněte zdarma

BOW s n-gramy a velikostí slovníku

V tomto cvičení si znovu procvičíš vytváření bag-of-words, tentokrát s využitím datasetu reviews s recenzemi produktů z Amazonu. Hlavním úkolem bude omezit velikost slovníku a nastavit délku sekvencí tokenů.

Toto cvičení je součástí kurzu

Sentiment Analysis v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Importuj vektorizér z knihovny sklearn.
  • Sestavuj vektorizér a nezapomeň nastavit tyto parametry: velikost slovníku omez na 1000, zahrň pouze bigramy a ignoruj výrazy, které se vyskytují ve více než 500 dokumentech.
  • Fituj vektorizér na sloupec review.
  • Vytvoř DataFrame z reprezentace BOW.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

#Import the vectorizer
from sklearn.____.____ import ____

# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)

# Transform the review
X_review = vect.transform(reviews.review)

# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())
Upravit a spustit kód