One-hot encoding và biến giả (dummy variables)
Để sử dụng biến phân loại trong mô hình Machine Learning, trước hết bạn cần biểu diễn chúng dưới dạng số. Hai cách phổ biến nhất là one-hot encoding hoặc dùng biến giả (dummy variables). Trong bài này, bạn sẽ tạo cả hai kiểu mã hóa và so sánh các tập cột được tạo ra. Ta sẽ tiếp tục dùng cùng DataFrame từ bài trước, đã được nạp là so_survey_df, và tập trung vào cột Country.
Bài tập này là một phần của khóa học
Feature Engineering cho Machine Learning bằng Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Convert the Country column to a one hot encoded Data Frame
one_hot_encoded = ____(____, ____=['Country'], prefix='OH')
# Print the columns names
print(one_hot_encoded.columns)