Zacznij terazZacznij za darmo

Rozdzielanie cen domów za pomocą UMAP

Zbiór danych o sprzedaży domów w Kalifornii (house_sales_df) poddałeś już redukcji wymiarowości przy użyciu PCA i t-SNE. Teraz zastosuj UMAP. Wyniki obu metod są podobne, jednak UMAP jest zazwyczaj wydajniejszy obliczeniowo. Lepiej też zachowuje globalną strukturę danych. W praktyce oznacza to, że odległość między klastrami można interpretować jako miarę podobieństwa — czego nie można było robić w przypadku t-SNE.

Pamiętaj, że zmienną docelową w house_sales_df jest price. Ustaw num_comp = 2. Pakiety tidyverse i embed są już załadowane.

To ćwiczenie jest częścią kursu

Redukcja wymiarowości w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Dopasuj UMAP do wszystkich predyktorów w house_sales_df, używając step_umap() w przepisie, i zapisz przekształcone dane w umap_df.
  • Zwizualizuj wymiary UMAP za pomocą ggplot(), kodując zmienną docelową price kolorem.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Fit UMAP
set.seed(1234)
umap_df <- ___(___ ~ ., data = ___) %>% 
  ___(___()) %>% 
  ___(___(), num_comp = 2) %>% 
  prep() %>% 
  ___() 

# Plot UMAP
___ %>%  
  ___(aes(x = ___, y = ___, color = ___)) +
  ___(alpha = 0.7) +
  scale_color_gradient(low="gray", high="blue")
Edytuj i uruchom kod