Phân phối train/test
Trong một buổi phỏng vấn Machine Learning, gần như chắc chắn bạn sẽ làm việc với dữ liệu huấn luyện (training) và dữ liệu kiểm tra (test). Như đã thảo luận, hiệu suất mô hình có thể kém nếu phân phối của tập huấn luyện và tập kiểm tra khác nhau.
Trong bài tập này, bạn sẽ dùng các hàm từ sklearn.model_selection cùng với seaborn và matplotlib.pyplot để tách loan_data thành tập huấn luyện và tập kiểm tra, đồng thời trực quan hóa phân phối của chúng để phát hiện bất kỳ sai lệch nào.
Lưu ý: seaborn và matplotlib.pyplot đã được nhập sẵn trong không gian làm việc của bạn với bí danh lần lượt là sns và plt.
Pipeline hiện đã bao gồm Train/Test split:

Bài tập này là một phần của khóa học
Luyện tập câu hỏi phỏng vấn Machine Learning bằng Python
Hướng dẫn bài tập
- Lấy tập con của
loan_datachỉ gồm các đặc trưngCredit ScorevàAnnual Income, và biến mục tiêuLoan Statustheo đúng thứ tự đó. - Tạo phép chia 80/20 cho
loan_datavà gán vàoloan_data_subset. - Tạo pairplot cho
trainingSetvàtestSet(theo thứ tự đó), đặt đối sốhuelà biến mục tiêuLoan Status.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]
# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)
# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()