НачатьНачать бесплатно

Векторы BoW для рецензий на фильмы

В этом упражнении вам даны два объекта pandas Series — X_train и X_test, содержащие рецензии на фильмы. Они представляют собой обучающую и тестовую выборки рецензий соответственно. Ваша задача — выполнить предобработку рецензий и сформировать векторы BoW для обоих наборов с помощью CountVectorizer.

Как только мы получим матрицы векторов BoW — X_train_bow и X_test_bow — у нас будет всё необходимое, чтобы применить модель машинного обучения и провести анализ тональности.

Это упражнение является частью курса

Конструирование признаков для NLP на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте CountVectorizer из библиотеки sklearn.
  • Создайте объект CountVectorizer с именем vectorizer. Убедитесь, что все слова приводятся к нижнему регистру и стоп-слова english удаляются.
  • Используя X_train, обучите vectorizer, а затем примените его для преобразования X_train и получения набора векторов BoW X_train_bow.
  • Преобразуйте X_test с помощью vectorizer, чтобы получить набор векторов BoW X_test_bow.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)

# Fit and transform X_train
X_train_bow = vectorizer.____(____)

# Transform X_test
X_test_bow = vectorizer.____(____)

# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)
Редактировать и запускать код