Отзывы о товарах с регуляризацией
В этом упражнении вы снова будете работать с набором данных reviews, содержащим отзывы о товарах Amazon. Вектор меток y отражает тональность: 1 — положительная, 0 — в остальных случаях. Матрица X содержит все числовые признаки, созданные с помощью подхода «мешок слов» (BOW).
Вам предстоит обучить две модели логистической регрессии с разными уровнями регуляризации и сравнить их результаты на тестовой выборке. Напомним, что регуляризация — это способ контролировать сложность модели. Чем выше регуляризация, тем менее гибкой становится модель, но тем лучше она обобщает данные. Сильно регуляризованные модели, как правило, уступают в точности нерегуляризованным.
Это упражнение является частью курса
Анализ тональности текста на Python
Инструкции к упражнению
- Разбейте данные на обучающую и тестовую выборки.
- Обучите модель логистической регрессии с параметром регуляризации
1000. Обучите вторую модель логистической регрессии с параметром регуляризации0.001. - Выведите значения точности обеих моделей на тестовой выборке.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Split data into training and testing
____, ____, ____, ____ = train_test_split(____, ____, test_size=0.2, random_state=123)
# Train a logistic regression with regularization of 1000
log_reg1 = ____(____=1000).fit(X_train, y_train)
# Train a logistic regression with regularization of 0.001
log_reg2 = ____(____=0.001).fit(X_train, y_train)
# Print the accuracies
print('Accuracy of model 1: ', log_reg1.____(____, ____))
print('Accuracy of model 2: ', log_reg2.____(____, ____))