Twitter verisinin performans metrikleri
Tweet'lerin duyarlılığını tahmin eden bir lojistik regresyon modeli eğitecek ve test kümesi üzerinde farklı metriklerle performansını değerlendireceksin.
Senin için bir X matrisi oluşturuldu. Bu matris, text sütununa uygulanan BOW ile elde edilen özellikleri içeriyor.
Etiketler y adlı bir vektörde saklanıyor. y vektöründe negatif tweet'ler için 0, nötr için 1, pozitif için 2 bulunuyor.
Her ne kadar 3 sınıfımız olsa da bu hâlâ bir sınıflandırma problemidir. Doğruluk (accuracy) yine doğru tahmin edilen örneklerin oranını ölçer. Artık karışıklık matrisi 3x3 boyutunda olacak; her satır sırasıyla 2, 1 ve 0 sınıfları için tahmin edilen örnek sayısını, her sütun ise sırasıyla 2, 1 ve 0 sınıflarındaki gerçek örnek sayılarını verecek.
Gerekli tüm paketler senin için içe aktarıldı.
Bu egzersiz, kursun bir parçasıdır
Python ile Duygu Analizi
Egzersiz talimatları
- Eğitim/test ayrımını yap ve
yile stratify et. - Bir lojistik regresyon sınıflandırıcısı eğit.
- Test kümesi üzerinde tahmin yap.
- Test kümesinde elde edilen doğruluk skorunu ve karışıklık matrisini yazdır.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Split the data into training and testing sets
X_train, X_test, y_train, y_test = ____(X, y, test_size=0.3, random_state=123, ____=y)
# Train a logistic regression
log_reg = ____.____(___, ____)
# Make predictions on the test set
y_predicted = log_reg.____(___)
# Print the performance metrics
print('Accuracy score test set: ', ____(y_test, y_predicted))
print('Confusion matrix test set: \n', ____(y_test, y_predicted)/len(y_test))