BaşlayınÜcretsiz başlayın

Twitter verisinin performans metrikleri

Tweet'lerin duyarlılığını tahmin eden bir lojistik regresyon modeli eğitecek ve test kümesi üzerinde farklı metriklerle performansını değerlendireceksin.

Senin için bir X matrisi oluşturuldu. Bu matris, text sütununa uygulanan BOW ile elde edilen özellikleri içeriyor.

Etiketler y adlı bir vektörde saklanıyor. y vektöründe negatif tweet'ler için 0, nötr için 1, pozitif için 2 bulunuyor. Her ne kadar 3 sınıfımız olsa da bu hâlâ bir sınıflandırma problemidir. Doğruluk (accuracy) yine doğru tahmin edilen örneklerin oranını ölçer. Artık karışıklık matrisi 3x3 boyutunda olacak; her satır sırasıyla 2, 1 ve 0 sınıfları için tahmin edilen örnek sayısını, her sütun ise sırasıyla 2, 1 ve 0 sınıflarındaki gerçek örnek sayılarını verecek.

Gerekli tüm paketler senin için içe aktarıldı.

Bu egzersiz, kursun bir parçasıdır

Python ile Duygu Analizi

Kursa Göz Atın

Egzersiz talimatları

  • Eğitim/test ayrımını yap ve y ile stratify et.
  • Bir lojistik regresyon sınıflandırıcısı eğit.
  • Test kümesi üzerinde tahmin yap.
  • Test kümesinde elde edilen doğruluk skorunu ve karışıklık matrisini yazdır.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Split the data into training and testing sets
X_train, X_test, y_train, y_test = ____(X, y, test_size=0.3, random_state=123, ____=y)

# Train a logistic regression
log_reg = ____.____(___, ____)

# Make predictions on the test set
y_predicted = log_reg.____(___)

# Print the performance metrics
print('Accuracy score test set: ', ____(y_test, y_predicted))
print('Confusion matrix test set: \n', ____(y_test, y_predicted)/len(y_test))
Kodu Düzenle ve Çalıştır