BaşlayınÜcretsiz başlayın

Eğitim/test dağılımları

Bir Machine Learning mülakatında neredeyse kesin olarak eğitim verisi ve test verisiyle çalışırsın. Daha önce tartıştığımız gibi, eğitim ve test veri kümelerinin dağılımları farklıysa model performansı düşebilir.

Bu egzersizde, sklearn.model_selection fonksiyonlarının yanı sıra seaborn ve matplotlib.pyplot kullanarak loan_data verisini bir eğitim seti ve bir test setine bölecek, ardından dağılımlarını görselleştirip olası tutarsızlıkları tespit edeceksin.

seaborn ve matplotlib.pyplot'ın çalışma alanına zaten aktarılıp sırasıyla sns ve plt olarak kısaltıldığını unutma.

Boru hattına artık Train/Test split eklendi:

Machine learning pipeline

Bu egzersiz, kursun bir parçasıdır

Python ile Machine Learning Mülakat Sorularını Pratik Etme

Kursa Göz Atın

Egzersiz talimatları

  • loan_data içinden yalnızca Credit Score ve Annual Income özelliklerini ve hedef değişken Loan Status'u bu sırayla altküme olarak seç.
  • loan_data için 80/20 bir ayrım oluştur ve bunu loan_data_subset değişkenine ata.
  • trainingSet ve testSet için (bu sırayla) pairplot'lar oluştur ve hue argümanını hedef değişken Loan Status olarak ayarla.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]

# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)

# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()

plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
Kodu Düzenle ve Çalıştır