BOW med produktrecensioner
Du har redan övat på en BOW med ett litet dataset. Nu ska du tillämpa den på ett urval av Amazons produktrecensioner. Data har importerats åt dig och heter reviews. Den innehåller två kolumner. Den första heter score och har värdet 0 när recensionen är negativ och 1 när den är positiv. Den andra kolumnen heter review och innehåller texten från en kunds recension. Utforska gärna data i IPython Shell.
Din uppgift är att bygga ett BOW-vokabulär med kolumnen review.
Kom ihåg att du kan anropa metoden .get_feature_names() på vektoriseraren för att få en lista över alla vokabulärelement.
Den här övningen är en del av kursen
Sentimentanalys i Python
Övningsinstruktioner
- Skapa ett CountVectorizer-objekt och ange det maximala antalet särdrag.
- Träna vektoriseraren.
- Transformera den tränade vektoriseraren.
- Skapa en DataFrame där du omvandlar den glesa matrisen till en tät array och se till att kolumnnamnen anges korrekt.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify max features
vect = ____(____=100)
# Fit the vectorizer
vect.____(reviews.review)
# Transform the review column
X_review = vect.____(reviews.review)
# Create the bow representation
X_df=pd.DataFrame(X_review._____, columns=___.____)
print(X_df.head())