Bắt đầu ngayBắt đầu miễn phí

Phân phối train/test

Trong một buổi phỏng vấn Machine Learning, gần như chắc chắn bạn sẽ làm việc với dữ liệu huấn luyện (training) và dữ liệu kiểm tra (test). Như đã thảo luận, hiệu suất mô hình có thể kém nếu phân phối của tập huấn luyện và tập kiểm tra khác nhau.

Trong bài tập này, bạn sẽ dùng các hàm từ sklearn.model_selection cùng với seabornmatplotlib.pyplot để tách loan_data thành tập huấn luyện và tập kiểm tra, đồng thời trực quan hóa phân phối của chúng để phát hiện bất kỳ sai lệch nào.

Lưu ý: seabornmatplotlib.pyplot đã được nhập sẵn trong không gian làm việc của bạn với bí danh lần lượt là snsplt.

Pipeline hiện đã bao gồm Train/Test split:

Machine learning pipeline

Bài tập này là một phần của khóa học

Luyện tập câu hỏi phỏng vấn Machine Learning bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Lấy tập con của loan_data chỉ gồm các đặc trưng Credit ScoreAnnual Income, và biến mục tiêu Loan Status theo đúng thứ tự đó.
  • Tạo phép chia 80/20 cho loan_data và gán vào loan_data_subset.
  • Tạo pairplot cho trainingSettestSet (theo thứ tự đó), đặt đối số hue là biến mục tiêu Loan Status.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]

# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)

# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()

plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
Chỉnh sửa và Chạy Mã