Wektory BoW dla recenzji filmowych
W tym ćwiczeniu masz do dyspozycji dwie serie pandas – X_train i X_test – zawierające recenzje filmowe. Reprezentują one odpowiednio dane treningowe i testowe. Twoim zadaniem jest wstępne przetworzenie recenzji i wygenerowanie wektorów BoW dla obu zbiorów przy użyciu CountVectorizer.
Gdy już wygenerujesz macierze wektorów BoW X_train_bow i X_test_bow, będziesz dobrze przygotowany(-a) do zastosowania modelu uczenia maszynowego i przeprowadzenia analizy sentymentu.
To ćwiczenie jest częścią kursu
Inżynieria cech dla NLP w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj
CountVectorizerz bibliotekisklearn. - Utwórz obiekt
CountVectorizero nazwievectorizer. Zadbaj o to, aby wszystkie słowa były konwertowane na małe litery i aby usuwane były angielskie stop słowa (english). - Korzystając z
X_train, dopasujvectorizer, a następnie użyj go do transformacjiX_trainw celu wygenerowania zbioru wektorów BoWX_train_bow. - Przekształć
X_testza pomocąvectorizer, aby wygenerować zbiór wektorów BoWX_test_bow.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)
# Fit and transform X_train
X_train_bow = vectorizer.____(____)
# Transform X_test
X_test_bow = vectorizer.____(____)
# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)