開始使用免費開始

用 UMAP 區分房價

你已經用 PCA 和 t-SNE 降維了加州房屋銷售資料(house_sales_df)。接下來要使用 UMAP。UMAP 的最終結果與 t-SNE 很相似,但 UMAP 通常在計算上更有效率,且更努力保留整體(global)結構。實務上,這表示你可以把叢集之間的距離解讀為相似度的指標——這是 t-SNE 不容易做到的。

請記住,house_sales_df 的目標變數是 price。將 num_comp = 2tidyverseembed 套件已為你載入。

本練習屬於課程

R 的降維

檢視課程

練習說明

  • 在 recipe 中使用 step_umap()house_sales_df 中所有自變數(預測變數)擬合 UMAP,並將轉換後的資料存成 umap_df
  • 使用 ggplot() 繪製 UMAP 維度,並用顏色對應目標變數 price

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Fit UMAP
set.seed(1234)
umap_df <- ___(___ ~ ., data = ___) %>% 
  ___(___()) %>% 
  ___(___(), num_comp = 2) %>% 
  prep() %>% 
  ___() 

# Plot UMAP
___ %>%  
  ___(aes(x = ___, y = ___, color = ___)) +
  ___(alpha = 0.7) +
  scale_color_gradient(low="gray", high="blue")
編輯並執行程式碼