Zbuduj i oceń model: recenzje filmów
W tym zadaniu zbudujesz model regresji logistycznej na podstawie zbioru danych movies. Wynik jest zapisany w kolumnie label i przyjmuje wartość 1 dla pozytywnych recenzji oraz 0 dla negatywnych. Tekst recenzji został przekształcony metodą BOW na kolumny numeryczne.
Model klasyfikatora masz już zbudowany, ale do tej pory oceniałeś go na tych samych danych, które zostały użyte do trenowania. Teraz upewnij się, że oceniasz model na niewidocznym wcześniej zbiorze testowym. Jak zmienia się wydajność modelu, gdy jest oceniany na danych testowych?
To ćwiczenie jest częścią kursu
Analiza sentymentu w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj funkcję potrzebną do podziału danych na zbiór treningowy i testowy.
- Wykonaj podział, określając, że 20% danych ma stanowić zbiór testowy.
- Wytrenuj model regresji logistycznej.
- Wyświetl dokładność modelu na danych treningowych oraz na danych testowych.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the required packages
from sklearn.linear_model import LogisticRegression
____
# Define the vector of labels and matrix of features
y = movies.label
X = movies.drop('label', axis=1)
# Perform the train-test split
X_train, X_test, y_train, y_test = ____(X, y, ____=0.2, random_state=42)
# Build a logistic regression model and print out the accuracy
log_reg = ____.____
print('Accuracy on train set: ', log_reg.____(____, ____))
print('Accuracy on test set: ', log_reg.____(____, ____))