BOW med n-gram och vokabulärstorlek
I den här övningen får du öva på att bygga en bag-of-words igen, med hjälp av datamängden reviews med Amazon-produktrecensioner. Din huvuduppgift är att begränsa vokabulärets storlek och ange längden på tokenföljden.
Den här övningen är en del av kursen
Sentimentanalys i Python
Övningsinstruktioner
- Importera vektoriseraren från
sklearn. - Bygg vektoriseraren och se till att ange följande parametrar: vokabulärets storlek ska begränsas till 1 000, inkludera endast bigram och ignorera termer som förekommer i fler än 500 dokument.
- Anpassa vektoriseraren till kolumnen
review. - Skapa en DataFrame från BOW-representationen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
#Import the vectorizer
from sklearn.____.____ import ____
# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)
# Transform the review
X_review = vect.transform(reviews.review)
# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())