НачатьНачать бесплатно

Отзывы о товарах с регуляризацией

В этом упражнении вы снова будете работать с набором данных reviews, содержащим отзывы о товарах Amazon. Вектор меток y отражает тональность: 1 — положительная, 0 — в остальных случаях. Матрица X содержит все числовые признаки, созданные с помощью подхода «мешок слов» (BOW).

Вам предстоит обучить две модели логистической регрессии с разными уровнями регуляризации и сравнить их результаты на тестовой выборке. Напомним, что регуляризация — это способ контролировать сложность модели. Чем выше регуляризация, тем менее гибкой становится модель, но тем лучше она обобщает данные. Сильно регуляризованные модели, как правило, уступают в точности нерегуляризованным.

Это упражнение является частью курса

Анализ тональности текста на Python

Посмотреть курс

Инструкции к упражнению

  • Разбейте данные на обучающую и тестовую выборки.
  • Обучите модель логистической регрессии с параметром регуляризации 1000. Обучите вторую модель логистической регрессии с параметром регуляризации 0.001.
  • Выведите значения точности обеих моделей на тестовой выборке.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Split data into training and testing
____, ____, ____, ____ = train_test_split(____, ____, test_size=0.2, random_state=123)

# Train a logistic regression with regularization of 1000
log_reg1 = ____(____=1000).fit(X_train, y_train)
# Train a logistic regression with regularization of 0.001
log_reg2 = ____(____=0.001).fit(X_train, y_train)

# Print the accuracies
print('Accuracy of model 1: ', log_reg1.____(____, ____))
print('Accuracy of model 2: ', log_reg2.____(____, ____))
Редактировать и запускать код