BOW s n-gramy a velikostí slovníku
V tomto cvičení si znovu procvičíš vytváření bag-of-words, tentokrát s využitím datasetu reviews s recenzemi produktů z Amazonu. Hlavním úkolem bude omezit velikost slovníku a nastavit délku sekvencí tokenů.
Toto cvičení je součástí kurzu
Sentiment Analysis v Pythonu
Pokyny k cvičení
- Importuj vektorizér z knihovny
sklearn. - Sestavuj vektorizér a nezapomeň nastavit tyto parametry: velikost slovníku omez na 1000, zahrň pouze bigramy a ignoruj výrazy, které se vyskytují ve více než 500 dokumentech.
- Fituj vektorizér na sloupec
review. - Vytvoř DataFrame z reprezentace BOW.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
#Import the vectorizer
from sklearn.____.____ import ____
# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)
# Transform the review
X_review = vect.transform(reviews.review)
# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())