Rozdzielanie cen domów za pomocą UMAP
Zbiór danych o sprzedaży domów w Kalifornii (house_sales_df) poddałeś już redukcji wymiarowości przy użyciu PCA i t-SNE. Teraz zastosuj UMAP. Wyniki obu metod są podobne, jednak UMAP jest zazwyczaj wydajniejszy obliczeniowo. Lepiej też zachowuje globalną strukturę danych. W praktyce oznacza to, że odległość między klastrami można interpretować jako miarę podobieństwa — czego nie można było robić w przypadku t-SNE.
Pamiętaj, że zmienną docelową w house_sales_df jest price. Ustaw num_comp = 2. Pakiety tidyverse i embed są już załadowane.
To ćwiczenie jest częścią kursu
Redukcja wymiarowości w R
Instrukcje do ćwiczenia
- Dopasuj UMAP do wszystkich predyktorów w
house_sales_df, używającstep_umap()w przepisie, i zapisz przekształcone dane wumap_df. - Zwizualizuj wymiary UMAP za pomocą
ggplot(), kodując zmienną docelowąpricekolorem.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Fit UMAP
set.seed(1234)
umap_df <- ___(___ ~ ., data = ___) %>%
___(___()) %>%
___(___(), num_comp = 2) %>%
prep() %>%
___()
# Plot UMAP
___ %>%
___(aes(x = ___, y = ___, color = ___)) +
___(alpha = 0.7) +
scale_color_gradient(low="gray", high="blue")