ÎncepețiÎncepe gratuit

Tfidf și BOW pe aceleași date

În acest exercițiu, vei transforma coloana review din setul de date Amazon reviews folosind atât o reprezentare bag-of-words, cât și o transformare tfidf.

Construiește ambii vectorizatori, specificând doar numărul maxim de caracteristici egal cu 100. Creează DataFrame-uri după transformare și afișează primele 5 rânduri din fiecare.

Fii atent(ă) la modul în care specifici numărul maxim de caracteristici din vocabular. Un vocabular prea mare poate duce la deconectarea sesiunii tale.

Acest exercițiu face parte din cursul

Analiza sentimentelor în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă vectorizatorii BOW și Tfidf.
  • Construiește și antrenează un vectorizator BOW și unul Tfidf pe coloana review, limitând numărul de caracteristici create la 100.
  • Creează DataFrame-uri din reprezentările vectoriale transformate.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import the required packages
____

# Build a BOW and tfidf vectorizers from the review column and with max of 100 features
vect1 = ____(____=100).____(____.____)
vect2 = ____(____=100).____(____.____) 

# Transform the vectorizers
X1 = vect1.transform(reviews.review)
X2 = vect2.transform(reviews.review)
# Create DataFrames from the vectorizers 
X_df1 = pd.DataFrame(X1.____, columns=____.____)
X_df2 = pd.DataFrame(X2.____, columns=____.____)
print('Top 5 rows using BOW: \n', X_df1.head())
print('Top 5 rows using tfidf: \n', X_df2.head())
Editează și rulează codul