Kom igångKom igång gratis

Ange tokensekvensens längd med BOW

I videon såg vi att genom att ange olika tokenlängder – det vi kallade n-gram – kan vi bättre fånga kontexten, vilket kan vara avgörande.

I den här övningen arbetar du med ett urval av Amazons produktrecensioner. Din uppgift är att bygga ett BOW-vokabulär med hjälp av kolumnen review och ange tokensekvensens längd.

Den här övningen är en del av kursen

Sentimentanalys i Python

Visa kurs

Övningsinstruktioner

  • Bygg vektoriseraren och ange att tokensekvensens längd ska vara uni- och bigram.
  • Anpassa vektoriseraren.
  • Transformera den anpassade vektoriseraren.
  • Se till att kolumnnamnen i DataFrame är korrekt angivna.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)

# Transform the review column
X_review = vect.____(reviews.review)

# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())
Redigera och kör kod