Rozmiar słownika recenzji filmów
W tym ćwiczeniu przećwiczysz różne sposoby ograniczania rozmiaru słownika na przykładzie próbki zbioru danych movies z recenzjami filmów. Pierwsza kolumna to review – typ object – a druga to label, gdzie 0 oznacza recenzję negatywną, a 1 – pozytywną.
Trzy metody, których użyjesz, przekształcą kolumnę tekstową na nowe kolumny numeryczne, rejestrując liczbę wystąpień danego słowa lub frazy w każdej recenzji. Każda metoda da w efekcie inną liczbę nowych cech.
To ćwiczenie jest częścią kursu
Analiza sentymentu w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify size of vocabulary and fit
vect = CountVectorizer(____=____)
vect.fit(movies.review)
# Transform the review column
X_review = vect.transform(movies.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())