Zacznij terazZacznij za darmo

Tfidf i BOW na tych samych danych

W tym ćwiczeniu przekształcisz kolumnę review ze zbioru recenzji produktów Amazon, używając zarówno reprezentacji bag-of-words, jak i transformacji tfidf.

Zbuduj oba wektory, określając jedynie maksymalną liczbę cech równą 100. Utwórz ramki danych po transformacji i wyświetl 5 pierwszych wierszy każdej z nich.

Uważaj na to, jak określasz maksymalną liczbę cech w słowniku. Zbyt duży słownik może spowodować rozłączenie sesji.

To ćwiczenie jest częścią kursu

Analiza sentymentu w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj wektory BOW i Tfidf.
  • Zbuduj i dopasuj wektory BOW i Tfidf na podstawie kolumny review, ograniczając liczbę tworzonych cech do 100.
  • Utwórz ramki danych z przekształconych reprezentacji wektorowych.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import the required packages
____

# Build a BOW and tfidf vectorizers from the review column and with max of 100 features
vect1 = ____(____=100).____(____.____)
vect2 = ____(____=100).____(____.____) 

# Transform the vectorizers
X1 = vect1.transform(reviews.review)
X2 = vect2.transform(reviews.review)
# Create DataFrames from the vectorizers 
X_df1 = pd.DataFrame(X1.____, columns=____.____)
X_df2 = pd.DataFrame(X2.____, columns=____.____)
print('Top 5 rows using BOW: \n', X_df1.head())
print('Top 5 rows using tfidf: \n', X_df2.head())
Edytuj i uruchom kod