Sınıflandırma model performansını görselleştirme

Bu egzersizde, music_df veri kümesindeki "popularity" sütununun ikili değerlere dönüştürüldüğü bir sınıflandırma problemi çözeceksin. Buna göre 1, "popularity" sütununun medyanına eşit veya daha yüksek popülerliği; 0 ise medyanın altındaki popülerliği temsil eder.

Görevin, bir şarkının popüler olup olmadığını sınıflandırmak için üç farklı modelin sonuçlarını oluşturup görselleştirmek.

Veriler senin için X_train_scaled, X_test_scaled, y_train ve y_test olarak bölünmüş, ölçeklenmiş ve önceden yüklenmiştir. Ayrıca KNeighborsClassifier, DecisionTreeClassifier ve LogisticRegression içe aktarılmıştır.

Bu egzersiz, kursun bir parçasıdır

scikit-learn ile Supervised Learning

Kursa Göz Atın

Egzersiz talimatları

"Logistic Regression", "KNN" ve "Decision Tree Classifier" anahtarlarından oluşan bir sözlük oluştur ve sözlüğün değerlerini her modelin çağrısına ayarla.
models içindeki değerlere döngü kur.
6 parçalı bölme yapmak için bir KFold nesnesi başlat; shuffle değerini True, random_state değerini 12 olarak ayarla.
Modeli, ölçeklenmiş eğitim özniteliklerini, hedef eğitim kümesini kullanarak ve cv’yi kf’ye eşitleyerek çapraz doğrulama yap.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Create models dictionary
models = {"____": ____(), "____": ____(), "____": ____()}
results = []

# Loop through the models' values
for model in ____.____():
  
  # Instantiate a KFold object
  kf = ____(n_splits=____, random_state=____, shuffle=____)
  
  # Perform cross-validation
  cv_results = ____(____, ____, ____, cv=____)
  results.append(cv_results)
plt.boxplot(results, labels=models.keys())
plt.show()

Kodu Düzenle ve Çalıştır

Bu egzersiz, kursun bir parçasıdır

scikit-learn ile Supervised Learning

IntermediárioNível de habilidade

4.8+

Kursa Ücretsiz Başla

Bu bölümde sınıflandırma problemleriyle tanışacak ve bunları supervised learning teknikleriyle nasıl çözeceğini öğreneceksin. Veriyi eğitim ve test kümelerine ayırmayı, bir modeli eğitmeyi, tahmin yapmayı ve doğruluğu değerlendirmeyi göreceksin. Model karmaşıklığı ile performans arasındaki ilişkiyi keşfedecek ve öğrendiklerini bir churn veri kümesine uygulayarak, bir telekom şirketinin müşterilerinin churn durumunu sınıflandıracaksın.

Exercise 1: scikit-learn ile Machine Learning Exercise 2: İkili sınıflandırma Exercise 3: Supervised learning iş akışı Exercise 4: Sınıflandırma meydan okuması Exercise 5: k-En Yakın Komşular: Modeli Uydur Exercise 6: k-En Yakın Komşu: Tahmin Exercise 7: Model performansını ölçmek Exercise 8: Eğitim/test ayrımı + doğruluk hesaplama Exercise 9: Aşırı uyum ve yetersiz uyum Exercise 10: Model karmaşıklığını görselleştirme

Bu bölümde regresyona giriş yapacak ve reklam harcamalarına ilişkin bir veri kümesini kullanarak satış değerlerini tahmin eden modeller kuracaksın. Doğrusal regresyonun işleyişini ve R-kare ile kök ortalama kare hata gibi yaygın performans ölçütlerini öğreneceksin. k-katlı çapraz doğrulama yapacak ve aşırı uyum riskini azaltmak için regresyon modellerine düzenlileştirme uygulayacaksın.

Exercise 1: Regresyona giriş Exercise 2: Özellik oluşturma Exercise 3: Bir doğrusal regresyon modeli kurma Exercise 4: Doğrusal regresyon modelini görselleştirme Exercise 5: Doğrusal regresyonun temelleri Exercise 6: Regresyon için fit ve predict Exercise 7: Regresyon performansı Exercise 8: Çapraz doğrulama Exercise 9: R-kare için çapraz doğrulama Exercise 10: Çapraz doğrulama metriklerini analiz etme Exercise 11: Düzenlileştirilmiş regresyon Exercise 12: Düzenlileştirilmiş regresyon: Ridge Exercise 13: Özellik önemini belirlemek için lasso regresyonu

Modelleri eğittikten sonra, şimdi onları nasıl değerlendireceğini öğreneceksin. Bu bölümde scikit-learn kullanarak sınıflandırma modeli performansını analiz etmek için birkaç ölçüt ve bir görselleştirme tekniğiyle tanışacaksın. Ayrıca hiperparametre ayarlaması yoluyla sınıflandırma ve regresyon modellerini nasıl optimize edeceğini öğreneceksin.

Exercise 1: Modelin ne kadar iyi?Exercise 2: Birincil metriğe karar verme Exercise 3: Diyabet tahmin sınıflandırıcısını değerlendirme Exercise 4: Lojistik regresyon ve ROC eğrisi Exercise 5: Lojistik regresyon modeli oluşturma Exercise 6: ROC eğrisi Exercise 7: ROC AUC Exercise 8: Hiperparametre ayarı Exercise 9: GridSearchCV ile hiperparametre ayarlama Exercise 10: RandomizedSearchCV ile hiperparametre ayarlama

Eksik değerleri atama, kategorik verileri sayısal değerlere dönüştürme, veriyi ölçekleme, birden fazla supervised learning modelini aynı anda değerlendirme ve iş akışını hızlandırmak için boru hatları kurmayı öğren!

Exercise 1: Veriyi ön işleme Exercise 2: Sahte değişkenler (dummy variables) oluşturma Exercise 3: Kategorik özelliklerle regresyon Exercise 4: Eksik verilerle başa çıkma Exercise 5: Eksik verileri düşürme Exercise 6: Şarkı türü tahmini için pipeline: I Exercise 7: Şarkı türü tahmini için pipeline: II Exercise 8: Merkezleme ve ölçekleme Exercise 9: Regresyon için merkezleme ve ölçekleme Exercise 10: Sınıflandırma için merkezleme ve ölçekleme Exercise 11: Birden fazla modeli değerlendirme Exercise 12: Regresyon model performansını görselleştirme Exercise 13: Test kümesi üzerinde tahmin Exercise 14: Sınıflandırma model performansını görselleştirme

Geçerli egzersiz

Exercise 15: Şarkı popülerliğini tahmin etmek için pipeline Exercise 16: Tebrikler