Recenzje produktów z regularyzacją
W tym ćwiczeniu ponownie skorzystasz ze zbioru danych reviews zawierającego recenzje produktów Amazon. Wektor etykiet y przechowuje sentyment: 1 oznacza opinię pozytywną, a 0 – negatywną. Macierz X zawiera wszystkie cechy numeryczne utworzone metodą BOW.
Wytreninguj dwa modele regresji logistycznej z różnymi poziomami regularyzacji i porównaj ich wyniki na zbiorze testowym. Pamiętaj, że regularyzacja to sposób na kontrolowanie złożoności modelu – im mocniejsza regularyzacja, tym model jest mniej elastyczny, ale lepiej generalizuje. Modele z wysoką regularyzacją są często mniej dokładne niż te bez regularyzacji.
To ćwiczenie jest częścią kursu
Analiza sentymentu w Pythonie
Instrukcje do ćwiczenia
- Podziel dane na zbiór treningowy i testowy.
- Wytrenuj model regresji logistycznej z parametrem regularyzacji równym
1000. Następnie wytrenuj drugi model z parametrem regularyzacji równym0.001. - Wyświetl wyniki dokładności obu modeli na zbiorze testowym.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Split data into training and testing
____, ____, ____, ____ = train_test_split(____, ____, test_size=0.2, random_state=123)
# Train a logistic regression with regularization of 1000
log_reg1 = ____(____=1000).fit(X_train, y_train)
# Train a logistic regression with regularization of 0.001
log_reg2 = ____(____=0.001).fit(X_train, y_train)
# Print the accuracies
print('Accuracy of model 1: ', log_reg1.____(____, ____))
print('Accuracy of model 2: ', log_reg2.____(____, ____))