Distribusi latih/uji
Dalam wawancara Machine Learning, Anda hampir pasti akan bekerja dengan data latih dan data uji. Seperti telah dibahas, kinerja model yang buruk dapat terjadi jika distribusi himpunan data latih dan uji berbeda.
Dalam latihan ini, Anda akan menggunakan fungsi dari sklearn.model_selection serta seaborn dan matplotlib.pyplot untuk membagi loan_data menjadi himpunan latih dan himpunan uji, serta memvisualisasikan distribusinya guna menemukan perbedaan.
Perhatikan bahwa seaborn dan matplotlib.pyplot sudah diimpor ke workspace Anda dan diberi alias masing-masing sebagai sns dan plt.
Pipeline sekarang mencakup Train/Test split:

Latihan ini merupakan bagian dari kursus
Berlatih Pertanyaan Wawancara Machine Learning dengan Python
Instruksi latihan
- Subset
loan_datahanya ke fiturCredit ScoredanAnnual Income, serta variabel targetLoan Status(dalam urutan tersebut). - Buat pembagian 80/20 dari
loan_datadan simpan sebagailoan_data_subset. - Buat pairplot untuk
trainingSetdantestSet(dalam urutan tersebut) dengan mengatur argumenhueke variabel targetLoan Status.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]
# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)
# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()