Огляди товарів і регуляризація
У цій вправі ви знову працюватимете з набором даних reviews — оглядами товарів на Amazon. Вектор міток y містить тональність: 1 — позитивна, 0 — інакше. Матриця X містить усі числові ознаки, створені підходом BOW.
Вам потрібно натренувати дві моделі логістичної регресії з різними рівнями регуляризації та порівняти їхню роботу на тестових даних. Пам'ятайте: регуляризація — це спосіб контролювати складність моделі. Чим сильніше модель регуляризована, тим вона менш гнучка, але краще узагальнює. Моделі з вищим рівнем регуляризації часто менш точні за нерегуляризовані.
Ця вправа є частиною курсу
Аналіз тональності в Python
Інструкції до вправи
- Розбийте дані на тренувальну та тестову вибірки.
- Натренуйте логістичну регресію з параметром регуляризації
1000. Натренуйте другу логістичну регресію з параметром регуляризації0.001. - Виведіть показники точності обох моделей на тестовій вибірці.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Split data into training and testing
____, ____, ____, ____ = train_test_split(____, ____, test_size=0.2, random_state=123)
# Train a logistic regression with regularization of 1000
log_reg1 = ____(____=1000).fit(X_train, y_train)
# Train a logistic regression with regularization of 0.001
log_reg2 = ____(____=0.001).fit(X_train, y_train)
# Print the accuracies
print('Accuracy of model 1: ', log_reg1.____(____, ____))
print('Accuracy of model 2: ', log_reg2.____(____, ____))