Mulai sekarangMulai gratis

Distribusi latih/uji

Dalam wawancara Machine Learning, Anda hampir pasti akan bekerja dengan data latih dan data uji. Seperti telah dibahas, kinerja model yang buruk dapat terjadi jika distribusi himpunan data latih dan uji berbeda.

Dalam latihan ini, Anda akan menggunakan fungsi dari sklearn.model_selection serta seaborn dan matplotlib.pyplot untuk membagi loan_data menjadi himpunan latih dan himpunan uji, serta memvisualisasikan distribusinya guna menemukan perbedaan.

Perhatikan bahwa seaborn dan matplotlib.pyplot sudah diimpor ke workspace Anda dan diberi alias masing-masing sebagai sns dan plt.

Pipeline sekarang mencakup Train/Test split:

Machine learning pipeline

Latihan ini merupakan bagian dari kursus

Berlatih Pertanyaan Wawancara Machine Learning dengan Python

Lihat Kursus

Instruksi latihan

  • Subset loan_data hanya ke fitur Credit Score dan Annual Income, serta variabel target Loan Status (dalam urutan tersebut).
  • Buat pembagian 80/20 dari loan_data dan simpan sebagai loan_data_subset.
  • Buat pairplot untuk trainingSet dan testSet (dalam urutan tersebut) dengan mengatur argumen hue ke variabel target Loan Status.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]

# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)

# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()

plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
Edit dan Jalankan Kode