Pasul 3: Construirea unui clasificator
Acesta este ultimul pas în predicția analizei de sentiment. Am explorat și am îmbogățit setul de date cu caracteristici legate de sentiment și am creat vectori numerici din acesta.
Vei folosi setul de date construit în pașii anteriori. Acesta conține o caracteristică pentru lungimea recenziilor și 200 de caracteristici create cu vectorizatorul Tfidf.
Sarcina ta este să antrenezi o regresie logistică pentru a prezice sentimentul. Datele au fost importate pentru tine și se numesc reviews_transformed. Ținta se numește score și este binară: 1 când recenzia produsului este pozitivă și 0 în caz contrar.
Antrenează un model de regresie logistică și evaluează performanța acestuia pe datele de testare. Cât de bine se descurcă modelul?
Toate pachetele necesare au fost importate pentru tine.
Acest exercițiu face parte din cursul
Analiza sentimentelor în Python
Instrucțiuni pentru exercițiu
- Realizează împărțirea în seturi de antrenament și de testare, alocând 20% din date pentru testare și setând seed-ul aleatoriu la
456. - Antrenează un model de regresie logistică.
- Prezice clasa.
- Afișează acuratețea și matricea de confuzie pe setul de testare.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Define X and y
y = reviews_transformed.score
X = reviews_transformed.drop('score', axis=1)
# Train/test split
X_train, X_test, y_train, y_test = ____(____, ____, ____=0.2, ____=456)
# Train a logistic regression
log_reg = ____.____(____, ____)
# Predict the labels
y_predicted = log_reg.____(____)
# Print accuracy score and confusion matrix on test set
print('Accuracy on the test set: ', ____(____, ____))
print(____(____, ____)/len(y_test))