Ange tokensekvensens längd med BOW
I videon såg vi att genom att ange olika tokenlängder – det vi kallade n-gram – kan vi bättre fånga kontexten, vilket kan vara avgörande.
I den här övningen arbetar du med ett urval av Amazons produktrecensioner. Din uppgift är att bygga ett BOW-vokabulär med hjälp av kolumnen review och ange tokensekvensens längd.
Den här övningen är en del av kursen
Sentimentanalys i Python
Övningsinstruktioner
- Bygg vektoriseraren och ange att tokensekvensens längd ska vara uni- och bigram.
- Anpassa vektoriseraren.
- Transformera den anpassade vektoriseraren.
- Se till att kolumnnamnen i DataFrame är korrekt angivna.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)
# Transform the review column
X_review = vect.____(reviews.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())