Kom igångKom igång gratis

Tfidf och BOW på samma data

I den här övningen ska du omvandla kolumnen review i Amazon-produktdatamängden reviews med både en bag-of-words- och en tfidf-transformation.

Bygg båda vektoriserarna och ange enbart det maximala antalet särdrag till 100. Skapa DataFrames efter omvandlingen och skriv ut de 5 första raderna i varje.

Var noggrann när du anger det maximala antalet särdrag i vokabulären. En stor vokabulärstorlek kan leda till att din session kopplas ned.

Den här övningen är en del av kursen

Sentimentanalys i Python

Visa kurs

Övningsinstruktioner

  • Importera BOW- och Tfidf-vektoriserarna.
  • Bygg och anpassa en BOW- och en Tfidf-vektoriserare från kolumnen review och begränsa antalet skapade särdrag till 100.
  • Skapa DataFrames från de omvandlade vektorrepresentationerna.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import the required packages
____

# Build a BOW and tfidf vectorizers from the review column and with max of 100 features
vect1 = ____(____=100).____(____.____)
vect2 = ____(____=100).____(____.____) 

# Transform the vectorizers
X1 = vect1.transform(reviews.review)
X2 = vect2.transform(reviews.review)
# Create DataFrames from the vectorizers 
X_df1 = pd.DataFrame(X1.____, columns=____.____)
X_df2 = pd.DataFrame(X2.____, columns=____.____)
print('Top 5 rows using BOW: \n', X_df1.head())
print('Top 5 rows using tfidf: \n', X_df2.head())
Redigera och kör kod