Kom igångKom igång gratis

BOW med n-gram och vokabulärstorlek

I den här övningen får du öva på att bygga en bag-of-words igen, med hjälp av datamängden reviews med Amazon-produktrecensioner. Din huvuduppgift är att begränsa vokabulärets storlek och ange längden på tokenföljden.

Den här övningen är en del av kursen

Sentimentanalys i Python

Visa kurs

Övningsinstruktioner

  • Importera vektoriseraren från sklearn.
  • Bygg vektoriseraren och se till att ange följande parametrar: vokabulärets storlek ska begränsas till 1 000, inkludera endast bigram och ignorera termer som förekommer i fler än 500 dokument.
  • Anpassa vektoriseraren till kolumnen review.
  • Skapa en DataFrame från BOW-representationen.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

#Import the vectorizer
from sklearn.____.____ import ____

# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)

# Transform the review
X_review = vect.transform(reviews.review)

# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())
Redigera och kör kod