Tfidf i BOW na tych samych danych
W tym ćwiczeniu przekształcisz kolumnę review ze zbioru recenzji produktów Amazon, używając zarówno reprezentacji bag-of-words, jak i transformacji tfidf.
Zbuduj oba wektory, określając jedynie maksymalną liczbę cech równą 100. Utwórz ramki danych po transformacji i wyświetl 5 pierwszych wierszy każdej z nich.
Uważaj na to, jak określasz maksymalną liczbę cech w słowniku. Zbyt duży słownik może spowodować rozłączenie sesji.
To ćwiczenie jest częścią kursu
Analiza sentymentu w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj wektory BOW i Tfidf.
- Zbuduj i dopasuj wektory BOW i Tfidf na podstawie kolumny
review, ograniczając liczbę tworzonych cech do 100. - Utwórz ramki danych z przekształconych reprezentacji wektorowych.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the required packages
____
# Build a BOW and tfidf vectorizers from the review column and with max of 100 features
vect1 = ____(____=100).____(____.____)
vect2 = ____(____=100).____(____.____)
# Transform the vectorizers
X1 = vect1.transform(reviews.review)
X2 = vect2.transform(reviews.review)
# Create DataFrames from the vectorizers
X_df1 = pd.DataFrame(X1.____, columns=____.____)
X_df2 = pd.DataFrame(X2.____, columns=____.____)
print('Top 5 rows using BOW: \n', X_df1.head())
print('Top 5 rows using tfidf: \n', X_df2.head())