НачатьНачать бесплатно

Построение и оценка модели: рецензии на фильмы

В этом задании вы построите модель логистической регрессии на основе набора данных movies. Оценка хранится в столбце label: значение 1 соответствует положительной рецензии, 0 — отрицательной. Текст рецензий преобразован с помощью метода «мешка слов» (BOW) в числовые столбцы.

Вы уже построили классификатор, однако оценивали его на тех же данных, что использовались при обучении. Теперь проверьте модель на отложенной тестовой выборке. Как изменится качество модели при оценке на тестовых данных?

Это упражнение является частью курса

Анализ тональности текста на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте функцию, необходимую для разбивки данных на обучающую и тестовую выборки.
  • Выполните разбивку, указав, что 20% данных должны использоваться в качестве тестовой выборки.
  • Обучите модель логистической регрессии.
  • Выведите на экран точность модели на обучающих и на тестовых данных.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the required packages
from sklearn.linear_model import LogisticRegression
____

# Define the vector of labels and matrix of features
y = movies.label
X = movies.drop('label', axis=1)

# Perform the train-test split
X_train, X_test, y_train, y_test = ____(X, y, ____=0.2, random_state=42)

# Build a logistic regression model and print out the accuracy
log_reg = ____.____
print('Accuracy on train set: ', log_reg.____(____, ____))
print('Accuracy on test set: ', log_reg.____(____, ____))
Редактировать и запускать код