Bắt đầu ngayBắt đầu miễn phí

Tách biệt giá nhà với UMAP

Bạn đã giảm số chiều của dữ liệu bán nhà ở California (house_sales_df) bằng PCA và t-SNE. Bây giờ bạn sẽ dùng UMAP. Kết quả cuối cùng của UMAP rất giống với t-SNE, tuy nhiên UMAP thường hiệu quả tính toán hơn. UMAP cũng cố gắng giữ lại nhiều cấu trúc toàn cục hơn. Nói thực tế, điều này nghĩa là bạn có thể diễn giải khoảng cách giữa các cụm như một thước đo mức độ tương đồng — điều mà bạn không thể làm với t-SNE.

Nhớ rằng biến đích của house_sales_dfprice. Đặt num_comp = 2. Các gói tidyverseembed đã được nạp sẵn cho bạn.

Bài tập này là một phần của khóa học

Giảm Chiều Dữ Liệu với R

Xem khóa học

Hướng dẫn bài tập

  • Khớp UMAP cho tất cả các biến dự báo trong house_sales_df bằng step_umap() trong một recipe và lưu dữ liệu đã biến đổi vào umap_df.
  • Vẽ các chiều UMAP bằng ggplot(), mã hóa biến đích price bằng màu sắc.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Fit UMAP
set.seed(1234)
umap_df <- ___(___ ~ ., data = ___) %>% 
  ___(___()) %>% 
  ___(___(), num_comp = 2) %>% 
  prep() %>% 
  ___() 

# Plot UMAP
___ %>%  
  ___(aes(x = ___, y = ___, color = ___)) +
  ___(alpha = 0.7) +
  scale_color_gradient(low="gray", high="blue")
Chỉnh sửa và Chạy Mã