Шаг 3: построение классификатора
Это последний шаг в задаче предсказания тональности. Мы изучили наш набор данных, дополнили его признаками, связанными с тональностью, и преобразовали текст в числовые векторы.
Вы будете работать с набором данных, созданным на предыдущих шагах. Он содержит признак длины отзывов и 200 признаков, полученных с помощью Tfidf-векторизатора.
Ваша задача — обучить логистическую регрессию для предсказания тональности. Данные уже загружены и доступны в переменной reviews_transformed. Целевой признак называется score и принимает два значения: 1 — если отзыв положительный, 0 — в противном случае.
Обучите модель логистической регрессии и оцените её качество на тестовых данных. Насколько хорошо справляется модель?
Все необходимые пакеты уже импортированы.
Это упражнение является частью курса
Анализ тональности текста на Python
Инструкции к упражнению
- Разделите данные на обучающую и тестовую выборки, выделив 20% данных для тестирования и задав случайное зерно равным
456. - Обучите модель логистической регрессии.
- Предскажите классы.
- Выведите метрику точности и матрицу ошибок на тестовой выборке.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Define X and y
y = reviews_transformed.score
X = reviews_transformed.drop('score', axis=1)
# Train/test split
X_train, X_test, y_train, y_test = ____(____, ____, ____=0.2, ____=456)
# Train a logistic regression
log_reg = ____.____(____, ____)
# Predict the labels
y_predicted = log_reg.____(____)
# Print accuracy score and confusion matrix on test set
print('Accuracy on the test set: ', ____(____, ____))
print(____(____, ____)/len(y_test))