ÎncepețiÎncepe gratuit

Metrici de performanță pe datele de pe Twitter

Vei antrena un model de regresie logistică care prezice sentimentul tweet-urilor și îi vei evalua performanța pe setul de testare folosind diferite metrici.

O matrice X a fost creată pentru tine. Aceasta conține caracteristici generate cu un BOW pe coloana text.

Etichetele sunt stocate într-un vector numit y. Vectorul y are valoarea 0 pentru tweet-urile negative, 1 pentru cele neutre și 2 pentru cele pozitive.
Deși avem 3 clase, aceasta rămâne tot o problemă de clasificare. Acuratețea măsoară în continuare proporția instanțelor clasificate corect. Matricea de confuzie va avea acum dimensiunea 3x3: fiecare rând indică numărul de cazuri prezise pentru clasele 2, 1 și 0, iar fiecare coloană – numărul real de cazuri din clasele 2, 1 și 0.

Toate pachetele necesare au fost deja importate.

Acest exercițiu face parte din cursul

Analiza sentimentelor în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Realizează împărțirea în seturi de antrenament/testare și folosește y pentru stratificare.
  • Antrenează un clasificator de regresie logistică.
  • Prezice performanța pe setul de testare.
  • Afișează scorul de acuratețe și matricea de confuzie obținute pe setul de testare.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Split the data into training and testing sets
X_train, X_test, y_train, y_test = ____(X, y, test_size=0.3, random_state=123, ____=y)

# Train a logistic regression
log_reg = ____.____(___, ____)

# Make predictions on the test set
y_predicted = log_reg.____(___)

# Print the performance metrics
print('Accuracy score test set: ', ____(y_test, y_predicted))
print('Confusion matrix test set: \n', ____(y_test, y_predicted)/len(y_test))
Editează și rulează codul