Metrici de performanță pe datele de pe Twitter
Vei antrena un model de regresie logistică care prezice sentimentul tweet-urilor și îi vei evalua performanța pe setul de testare folosind diferite metrici.
O matrice X a fost creată pentru tine. Aceasta conține caracteristici generate cu un BOW pe coloana text.
Etichetele sunt stocate într-un vector numit y. Vectorul y are valoarea 0 pentru tweet-urile negative, 1 pentru cele neutre și 2 pentru cele pozitive.
Deși avem 3 clase, aceasta rămâne tot o problemă de clasificare. Acuratețea măsoară în continuare proporția instanțelor clasificate corect. Matricea de confuzie va avea acum dimensiunea 3x3: fiecare rând indică numărul de cazuri prezise pentru clasele 2, 1 și 0, iar fiecare coloană – numărul real de cazuri din clasele 2, 1 și 0.
Toate pachetele necesare au fost deja importate.
Acest exercițiu face parte din cursul
Analiza sentimentelor în Python
Instrucțiuni pentru exercițiu
- Realizează împărțirea în seturi de antrenament/testare și folosește
ypentru stratificare. - Antrenează un clasificator de regresie logistică.
- Prezice performanța pe setul de testare.
- Afișează scorul de acuratețe și matricea de confuzie obținute pe setul de testare.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Split the data into training and testing sets
X_train, X_test, y_train, y_test = ____(X, y, test_size=0.3, random_state=123, ____=y)
# Train a logistic regression
log_reg = ____.____(___, ____)
# Make predictions on the test set
y_predicted = log_reg.____(___)
# Print the performance metrics
print('Accuracy score test set: ', ____(y_test, y_predicted))
print('Confusion matrix test set: \n', ____(y_test, y_predicted)/len(y_test))