One-hot encoding dữ liệu tín dụng
Đã đến lúc chuẩn bị các cột không phải số để bạn có thể thêm chúng vào mô hình LogisticRegression().
Sau khi tạo các cột mới bằng one-hot encoding, bạn có thể nối chúng với các cột dạng số để tạo một data frame mới. Data frame này sẽ được dùng xuyên suốt phần còn lại của khóa học để dự đoán xác suất vỡ nợ.
Nhớ chỉ one-hot encode các cột không phải số. Nếu làm vậy với các cột số, bạn sẽ tạo ra một bộ dữ liệu cực kỳ rộng!
Dữ liệu khoản vay tín dụng, cr_loan_clean, đã được nạp sẵn trong môi trường làm việc.
Bài tập này là một phần của khóa học
Mô hình hóa Rủi ro Tín dụng bằng Python
Hướng dẫn bài tập
- Tạo một tập dữ liệu cho tất cả các cột số gọi là
cred_numvà một tập cho các cột không phải số gọi làcred_str. - Dùng one-hot encoding trên
cred_strđể tạo tập dữ liệu mới gọi làcred_str_onehot. - Hợp nhất
cred_numvới dữ liệu đã one-hot encode mới và lưu kết quả thànhcr_loan_prep. - In ra danh sách cột của tập dữ liệu mới.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create two data sets for numeric and non-numeric data
____ = ____.select_dtypes(exclude=['object'])
____ = ____.select_dtypes(include=['object'])
# One-hot encode the non-numeric columns
____ = pd.____(____)
# Union the one-hot encoded columns to the numeric ones
____ = pd.concat([____, ____], axis=1)
# Print the columns in the new data set
print(____.columns)