用 UMAP 區分房價
你已經用 PCA 和 t-SNE 降維了加州房屋銷售資料(house_sales_df)。接下來要使用 UMAP。UMAP 的最終結果與 t-SNE 很相似,但 UMAP 通常在計算上更有效率,且更努力保留整體(global)結構。實務上,這表示你可以把叢集之間的距離解讀為相似度的指標——這是 t-SNE 不容易做到的。
請記住,house_sales_df 的目標變數是 price。將 num_comp = 2。tidyverse 與 embed 套件已為你載入。
本練習屬於課程
R 的降維
練習說明
- 在 recipe 中使用
step_umap()對house_sales_df中所有自變數(預測變數)擬合 UMAP,並將轉換後的資料存成umap_df。 - 使用
ggplot()繪製 UMAP 維度,並用顏色對應目標變數price。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Fit UMAP
set.seed(1234)
umap_df <- ___(___ ~ ., data = ___) %>%
___(___()) %>%
___(___(), num_comp = 2) %>%
prep() %>%
___()
# Plot UMAP
___ %>%
___(aes(x = ___, y = ___, color = ___)) +
___(alpha = 0.7) +
scale_color_gradient(low="gray", high="blue")