Začněte nyníZačněte zdarma

Metriky výkonu na twitterových datech

Natrénuješ model logistické regrese, který předpovídá sentiment tweetů, a vyhodnotíš jeho výkon na testovací sadě pomocí různých metrik.

Matice X je už připravená. Obsahuje příznaky vytvořené metodou BOW ze sloupce text.

Štítky jsou uloženy ve vektoru y. Hodnota 0 označuje negativní tweety, 1 neutrální a 2 pozitivní. I když máme 3 třídy, jde stále o klasifikační úlohu. Přesnost (accuracy) měří podíl správně předpovězených instancí. Matice záměn bude mít rozměr 3×3 — každý řádek udává počet předpovězených případů pro třídy 2, 1 a 0 a každý sloupec skutečný počet případů ve třídě 2, 1 a 0.

Všechny potřebné balíčky jsou již naimportované.

Toto cvičení je součástí kurzu

Sentiment Analysis v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Rozděl data na trénovací a testovací sadu a použij stratifikaci podle y.
  • Natrénuj klasifikátor logistické regrese.
  • Proveď predikci na testovací sadě.
  • Vypiš hodnotu přesnosti (accuracy score) a matici záměn získané na testovací sadě.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Split the data into training and testing sets
X_train, X_test, y_train, y_test = ____(X, y, test_size=0.3, random_state=123, ____=y)

# Train a logistic regression
log_reg = ____.____(___, ____)

# Make predictions on the test set
y_predicted = log_reg.____(___)

# Print the performance metrics
print('Accuracy score test set: ', ____(y_test, y_predicted))
print('Confusion matrix test set: \n', ____(y_test, y_predicted)/len(y_test))
Upravit a spustit kód