Budowanie i ocena modelu: dane z recenzji produktów
W tym ćwiczeniu zbudujesz regresję logistyczną na zbiorze danych reviews, który zawiera recenzje produktów Amazon wystawione przez klientów. Tablica y przechowuje sentyment: 1 oznacza pozytywny, a 0 – negatywny. Tablica X zawiera wszystkie cechy numeryczne utworzone metodą BOW. Możesz je swobodnie przejrzeć w konsoli IPython.
Twoim zadaniem jest zbudowanie modelu regresji logistycznej oraz obliczenie dokładności i macierzy pomyłek na zbiorze testowym.
Funkcje regresji logistycznej i podziału na zbiór treningowy/testowy zostały już zaimportowane.
To ćwiczenie jest częścią kursu
Analiza sentymentu w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj funkcje accuracy score i confusion matrix.
- Podziel dane na zbiór treningowy i testowy, przeznaczając 30% danych na testy i ustawiając ziarno losowości na
42. - Wytrenuj model regresji logistycznej.
- Wyświetl dokładność i macierz pomyłek, korzystając z danych testowych.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the accuracy and confusion matrix
____
# Split the data into training and testing
X_train, X_test, y_train, y_test = ____(____, ____, ____=0.3, ____=42)
# Build a logistic regression
log_reg = ____._____
# Predict the labels
y_predict = log_reg.predict(X_test)
# Print the performance metrics
print('Accuracy score of test data: ', ____(____, ____))
print('Confusion matrix of test data: \n', ____(____, ____)/len(y_test))