Tách biệt giá nhà với UMAP
Bạn đã giảm số chiều của dữ liệu bán nhà ở California (house_sales_df) bằng PCA và t-SNE. Bây giờ bạn sẽ dùng UMAP. Kết quả cuối cùng của UMAP rất giống với t-SNE, tuy nhiên UMAP thường hiệu quả tính toán hơn. UMAP cũng cố gắng giữ lại nhiều cấu trúc toàn cục hơn. Nói thực tế, điều này nghĩa là bạn có thể diễn giải khoảng cách giữa các cụm như một thước đo mức độ tương đồng — điều mà bạn không thể làm với t-SNE.
Nhớ rằng biến đích của house_sales_df là price. Đặt num_comp = 2. Các gói tidyverse và embed đã được nạp sẵn cho bạn.
Bài tập này là một phần của khóa học
Giảm Chiều Dữ Liệu với R
Hướng dẫn bài tập
- Khớp UMAP cho tất cả các biến dự báo trong
house_sales_dfbằngstep_umap()trong một recipe và lưu dữ liệu đã biến đổi vàoumap_df. - Vẽ các chiều UMAP bằng
ggplot(), mã hóa biến đíchpricebằng màu sắc.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Fit UMAP
set.seed(1234)
umap_df <- ___(___ ~ ., data = ___) %>%
___(___()) %>%
___(___(), num_comp = 2) %>%
prep() %>%
___()
# Plot UMAP
___ %>%
___(aes(x = ___, y = ___, color = ___)) +
___(alpha = 0.7) +
scale_color_gradient(low="gray", high="blue")