Metriky výkonu na twitterových datech
Natrénuješ model logistické regrese, který předpovídá sentiment tweetů, a vyhodnotíš jeho výkon na testovací sadě pomocí různých metrik.
Matice X je už připravená. Obsahuje příznaky vytvořené metodou BOW ze sloupce text.
Štítky jsou uloženy ve vektoru y. Hodnota 0 označuje negativní tweety, 1 neutrální a 2 pozitivní.
I když máme 3 třídy, jde stále o klasifikační úlohu. Přesnost (accuracy) měří podíl správně předpovězených instancí. Matice záměn bude mít rozměr 3×3 — každý řádek udává počet předpovězených případů pro třídy 2, 1 a 0 a každý sloupec skutečný počet případů ve třídě 2, 1 a 0.
Všechny potřebné balíčky jsou již naimportované.
Toto cvičení je součástí kurzu
Sentiment Analysis v Pythonu
Pokyny k cvičení
- Rozděl data na trénovací a testovací sadu a použij stratifikaci podle
y. - Natrénuj klasifikátor logistické regrese.
- Proveď predikci na testovací sadě.
- Vypiš hodnotu přesnosti (accuracy score) a matici záměn získané na testovací sadě.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Split the data into training and testing sets
X_train, X_test, y_train, y_test = ____(X, y, test_size=0.3, random_state=123, ____=y)
# Train a logistic regression
log_reg = ____.____(___, ____)
# Make predictions on the test set
y_predicted = log_reg.____(___)
# Print the performance metrics
print('Accuracy score test set: ', ____(y_test, y_predicted))
print('Confusion matrix test set: \n', ____(y_test, y_predicted)/len(y_test))