Construiește și evaluează un model: recenzii de filme
În acest exercițiu, vei construi un model de regresie logistică folosind setul de date movies. Scorul este stocat în coloana label și are valoarea 1 când recenzia este pozitivă, respectiv 0 când este negativă. Textul recenziei a fost transformat, folosind metoda BOW, în coloane numerice.
Ai construit deja un clasificator, însă l-ai evaluat folosind aceleași date utilizate la antrenament. Asigură-te că de această dată evaluezi modelul pe un set de testare pe care nu l-a „văzut" anterior. Cum se schimbă performanța modelului când este evaluat pe setul de testare?
Acest exercițiu face parte din cursul
Analiza sentimentelor în Python
Instrucțiuni pentru exercițiu
- Importă funcția necesară pentru împărțirea în seturi de antrenament și testare.
- Realizează împărțirea antrenament/testare, specificând că 20% din date vor fi folosite ca set de testare.
- Antrenează un model de regresie logistică.
- Afișează acuratețea modelului atât pe datele de antrenament, cât și pe cele de testare.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import the required packages
from sklearn.linear_model import LogisticRegression
____
# Define the vector of labels and matrix of features
y = movies.label
X = movies.drop('label', axis=1)
# Perform the train-test split
X_train, X_test, y_train, y_test = ____(X, y, ____=0.2, random_state=42)
# Build a logistic regression model and print out the accuracy
log_reg = ____.____
print('Accuracy on train set: ', log_reg.____(____, ____))
print('Accuracy on test set: ', log_reg.____(____, ____))