Векторы BoW для рецензий на фильмы
В этом упражнении вам даны два объекта pandas Series — X_train и X_test, содержащие рецензии на фильмы. Они представляют собой обучающую и тестовую выборки рецензий соответственно. Ваша задача — выполнить предобработку рецензий и сформировать векторы BoW для обоих наборов с помощью CountVectorizer.
Как только мы получим матрицы векторов BoW — X_train_bow и X_test_bow — у нас будет всё необходимое, чтобы применить модель машинного обучения и провести анализ тональности.
Это упражнение является частью курса
Конструирование признаков для NLP на Python
Инструкции к упражнению
- Импортируйте
CountVectorizerиз библиотекиsklearn. - Создайте объект
CountVectorizerс именемvectorizer. Убедитесь, что все слова приводятся к нижнему регистру и стоп-словаenglishудаляются. - Используя
X_train, обучитеvectorizer, а затем примените его для преобразованияX_trainи получения набора векторов BoWX_train_bow. - Преобразуйте
X_testс помощьюvectorizer, чтобы получить набор векторов BoWX_test_bow.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)
# Fit and transform X_train
X_train_bow = vectorizer.____(____)
# Transform X_test
X_test_bow = vectorizer.____(____)
# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)