Số chiều và thông tin đặc trưng
Hãy tưởng tượng bạn làm việc cho một ngân hàng và đã thu thập thông tin về các khoản vay khác nhau của nhiều khách hàng. Sếp của bạn muốn bạn bắt đầu khám phá khả năng dùng dữ liệu này để phân loại khách hàng vào các nhóm điểm tín dụng khác nhau. Một mẫu dữ liệu hiện có đã được nạp vào credit_df. Bạn muốn biết dữ liệu có bao nhiêu đặc trưng. Bạn cũng muốn xác định các đặc trưng sẽ không hữu ích cho việc phân loại khách hàng vào các nhóm tín dụng khác nhau.
Gói tidyverse đã được nạp sẵn cho bạn.
Bài tập này là một phần của khóa học
Giảm Chiều Dữ Liệu với R
Hướng dẫn bài tập
- Tìm số lượng đặc trưng trong
credit_df. - Tính phương sai của từng đặc trưng trong
credit_df. - Xác định đặc trưng có phương sai bằng không và gán nó cho
column_to_remove.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Find the number of features
___ %>% ___()
# Compute each column variance
credit_df %>%
___(___(___(), ~ ___(., na.rm = TRUE))) %>%
pivot_longer(everything(), names_to = "feature", values_to = "variance")
# Assign the zero-variance column
column_to_remove <- "___"