Tfidf och BOW på samma data
I den här övningen ska du omvandla kolumnen review i Amazon-produktdatamängden reviews med både en bag-of-words- och en tfidf-transformation.
Bygg båda vektoriserarna och ange enbart det maximala antalet särdrag till 100. Skapa DataFrames efter omvandlingen och skriv ut de 5 första raderna i varje.
Var noggrann när du anger det maximala antalet särdrag i vokabulären. En stor vokabulärstorlek kan leda till att din session kopplas ned.
Den här övningen är en del av kursen
Sentimentanalys i Python
Övningsinstruktioner
- Importera BOW- och Tfidf-vektoriserarna.
- Bygg och anpassa en BOW- och en Tfidf-vektoriserare från kolumnen
reviewoch begränsa antalet skapade särdrag till 100. - Skapa DataFrames från de omvandlade vektorrepresentationerna.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import the required packages
____
# Build a BOW and tfidf vectorizers from the review column and with max of 100 features
vect1 = ____(____=100).____(____.____)
vect2 = ____(____=100).____(____.____)
# Transform the vectorizers
X1 = vect1.transform(reviews.review)
X2 = vect2.transform(reviews.review)
# Create DataFrames from the vectorizers
X_df1 = pd.DataFrame(X1.____, columns=____.____)
X_df2 = pd.DataFrame(X2.____, columns=____.____)
print('Top 5 rows using BOW: \n', X_df1.head())
print('Top 5 rows using tfidf: \n', X_df2.head())