НачатьНачать бесплатно

Шаг 3: построение классификатора

Это последний шаг в задаче предсказания тональности. Мы изучили наш набор данных, дополнили его признаками, связанными с тональностью, и преобразовали текст в числовые векторы.

Вы будете работать с набором данных, созданным на предыдущих шагах. Он содержит признак длины отзывов и 200 признаков, полученных с помощью Tfidf-векторизатора.

Ваша задача — обучить логистическую регрессию для предсказания тональности. Данные уже загружены и доступны в переменной reviews_transformed. Целевой признак называется score и принимает два значения: 1 — если отзыв положительный, 0 — в противном случае.

Обучите модель логистической регрессии и оцените её качество на тестовых данных. Насколько хорошо справляется модель?

Все необходимые пакеты уже импортированы.

Это упражнение является частью курса

Анализ тональности текста на Python

Посмотреть курс

Инструкции к упражнению

  • Разделите данные на обучающую и тестовую выборки, выделив 20% данных для тестирования и задав случайное зерно равным 456.
  • Обучите модель логистической регрессии.
  • Предскажите классы.
  • Выведите метрику точности и матрицу ошибок на тестовой выборке.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Define X and y
y = reviews_transformed.score
X = reviews_transformed.drop('score', axis=1)

# Train/test split
X_train, X_test, y_train, y_test = ____(____, ____, ____=0.2, ____=456)

# Train a logistic regression
log_reg = ____.____(____, ____)
# Predict the labels
y_predicted = log_reg.____(____)

# Print accuracy score and confusion matrix on test set
print('Accuracy on the test set: ', ____(____, ____))
print(____(____, ____)/len(y_test))
Редактировать и запускать код