Eğitim/test dağılımları
Bir Machine Learning mülakatında neredeyse kesin olarak eğitim verisi ve test verisiyle çalışırsın. Daha önce tartıştığımız gibi, eğitim ve test veri kümelerinin dağılımları farklıysa model performansı düşebilir.
Bu egzersizde, sklearn.model_selection fonksiyonlarının yanı sıra seaborn ve matplotlib.pyplot kullanarak loan_data verisini bir eğitim seti ve bir test setine bölecek, ardından dağılımlarını görselleştirip olası tutarsızlıkları tespit edeceksin.
seaborn ve matplotlib.pyplot'ın çalışma alanına zaten aktarılıp sırasıyla sns ve plt olarak kısaltıldığını unutma.
Boru hattına artık Train/Test split eklendi:

Bu egzersiz, kursun bir parçasıdır
Python ile Machine Learning Mülakat Sorularını Pratik Etme
Egzersiz talimatları
loan_dataiçinden yalnızcaCredit ScoreveAnnual Incomeözelliklerini ve hedef değişkenLoan Status'u bu sırayla altküme olarak seç.loan_dataiçin 80/20 bir ayrım oluştur ve bunuloan_data_subsetdeğişkenine ata.trainingSetvetestSetiçin (bu sırayla) pairplot'lar oluştur vehueargümanını hedef değişkenLoan Statusolarak ayarla.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]
# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)
# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()