Tfidf și BOW pe aceleași date
În acest exercițiu, vei transforma coloana review din setul de date Amazon reviews folosind atât o reprezentare bag-of-words, cât și o transformare tfidf.
Construiește ambii vectorizatori, specificând doar numărul maxim de caracteristici egal cu 100. Creează DataFrame-uri după transformare și afișează primele 5 rânduri din fiecare.
Fii atent(ă) la modul în care specifici numărul maxim de caracteristici din vocabular. Un vocabular prea mare poate duce la deconectarea sesiunii tale.
Acest exercițiu face parte din cursul
Analiza sentimentelor în Python
Instrucțiuni pentru exercițiu
- Importă vectorizatorii BOW și Tfidf.
- Construiește și antrenează un vectorizator BOW și unul Tfidf pe coloana
review, limitând numărul de caracteristici create la 100. - Creează DataFrame-uri din reprezentările vectoriale transformate.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import the required packages
____
# Build a BOW and tfidf vectorizers from the review column and with max of 100 features
vect1 = ____(____=100).____(____.____)
vect2 = ____(____=100).____(____.____)
# Transform the vectorizers
X1 = vect1.transform(reviews.review)
X2 = vect2.transform(reviews.review)
# Create DataFrames from the vectorizers
X_df1 = pd.DataFrame(X1.____, columns=____.____)
X_df2 = pd.DataFrame(X2.____, columns=____.____)
print('Top 5 rows using BOW: \n', X_df1.head())
print('Top 5 rows using tfidf: \n', X_df2.head())