Biến đổi log và lũy thừa
Trong bài tập trước, bạn đã so sánh phân phối của tập huấn luyện và tập kiểm tra của loan_data. Điều này đặc biệt quan trọng trong phỏng vấn Machine Learning vì phân phối quan sát được sẽ quyết định việc bạn có cần dùng các kỹ thuật điều chỉnh phân phối của các đặc trưng về gần phân phối chuẩn hay không, để không vi phạm các giả định về tính chuẩn.
Trong bài này, bạn sẽ sử dụng phép biến đổi log và lũy thừa từ mô-đun scipy.stats trên đặc trưng Years of Credit History của loan_data, cùng với hàm distplot() từ seaborn, hàm này vẽ cả phân phối và ước lượng mật độ kernel (kernel density estimation).
Tất cả các gói liên quan đã được nhập sẵn cho bạn.
Đây là vị trí của bạn trong pipeline:

Bài tập này là một phần của khóa học
Luyện tập câu hỏi phỏng vấn Machine Learning bằng Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Subset loan_data
cr_yrs = ____['____']
# Histogram and kernel density estimate
plt.figure()
sns.____(____)
plt.show()