Zacznij terazZacznij za darmo

Krok 2: Budowanie wektoryzatora

W tym ćwiczeniu zbudujesz transformację TfIDF kolumny review w zbiorze danych reviews. Musisz określić n-gramy, stop words, wzorzec tokenów oraz rozmiar słownika.

To ostatni krok przed wytrenowaniem klasyfikatora przewidującego sentyment recenzji.

Pamiętaj, aby poprawnie ustawić maksymalną liczbę cech – zbyt duży słownik może spowodować rozłączenie sesji.

To ćwiczenie jest częścią kursu

Analiza sentymentu w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj wektoryzator Tfidf oraz domyślną listę angielskich stop words.
  • Zbuduj wektoryzator Tfidf, podając – w tej kolejności – następujące argumenty: jako stop words użyj domyślnej listy angielskich stop words; jako n-gramy użyj uni- i bigramów; maksymalna liczba cech powinna wynosić 200; uwzględniaj tylko słowa zgodne z podanym wzorcem.
  • Utwórz DataFrame przy użyciu wektoryzatora Tfidf.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import the TfidfVectorizer and default list of English stop words
from sklearn.feature_extraction.text import ____, ____

# Build the vectorizer
vect = ____(____=____, ____=(1, 2), ____=200, ____=r'\b[^\d\W][^\d\W]+\b').fit(reviews.review)
# Create sparse matrix from the vectorizer
X = vect.transform(reviews.review)

# Create a DataFrame
reviews_transformed = pd.DataFrame(X.____, columns=vect.____)
print('Top 5 rows of the DataFrame: \n', reviews_transformed.head())
Edytuj i uruchom kod