Menangani outlier
Pada latihan sebelumnya, Anda mempelajari bagaimana memvisualisasikan outlier dapat berguna dalam wawancara Machine Learning. Cara praktis lainnya untuk menangani outlier adalah dengan menghitung Z-score yang memberikan ambang untuk outlier sekitar +/-3 simpangan baku dari mean.
Dalam latihan ini, Anda akan menggunakan modul scipy.stats untuk menghitung Z-score dengan fungsi stats.zscore() dan fungsi mstats.winsorize() untuk mengganti outlier menggunakan teknik yang disebut Winsorizing.
Ingat dari video pelajaran bahwa titik-titik yang berada di atas dan/atau di bawah 1,5 kali IQR harus dicurigai sebagai kemungkinan outlier. Untuk langkah terakhir di latihan ini, nilai tersebut adalah 2120.
Paket yang relevan telah diimpor untuk Anda, dan kolom numerik serta kategorikal pada loan_data telah dipilah dan disimpan masing-masing sebagai numeric_cols dan categoric_cols.

Latihan ini merupakan bagian dari kursus
Berlatih Pertanyaan Wawancara Machine Learning dengan Python
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Print: before dropping
print(numeric_cols.mean())
print(numeric_cols.median())
print(numeric_cols.max())
# Create index of rows to keep
idx = (np.____(stats.____(____)) < 3).all(axis=1)
# Concatenate numeric and categoric subsets
ld_out_drop = pd.concat([numeric_cols.loc[____], categoric_cols.loc[____]], axis=1)
# Print: after dropping
print(ld_out_drop.mean())
print(ld_out_drop.median())
print(ld_out_drop.max())