Zacznij terazZacznij za darmo

Rozmiar słownika recenzji filmów

W tym ćwiczeniu przećwiczysz różne sposoby ograniczania rozmiaru słownika na przykładzie próbki zbioru danych movies z recenzjami filmów. Pierwsza kolumna to review – typ object – a druga to label, gdzie 0 oznacza recenzję negatywną, a 1 – pozytywną.

Trzy metody, których użyjesz, przekształcą kolumnę tekstową na nowe kolumny numeryczne, rejestrując liczbę wystąpień danego słowa lub frazy w każdej recenzji. Każda metoda da w efekcie inną liczbę nowych cech.

To ćwiczenie jest częścią kursu

Analiza sentymentu w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify size of vocabulary and fit
vect = CountVectorizer(____=____)
vect.fit(movies.review)

# Transform the review column
X_review = vect.transform(movies.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())
Edytuj i uruchom kod