Separarea prețurilor imobiliare cu UMAP
Ai redus dimensionalitatea datelor privind vânzările de locuințe din California (house_sales_df) folosind PCA și t-SNE. Acum vei aplica UMAP. Rezultatul final al UMAP este foarte similar cu cel al t-SNE, însă UMAP tinde să fie mai eficient din punct de vedere computațional. De asemenea, își propune să păstreze mai mult din structura globală a datelor. În termeni practici, acest lucru înseamnă că poți interpreta distanța dintre clustere ca o măsură a similarității — ceva ce nu era posibil cu t-SNE.
Reține că variabila țintă din house_sales_df este price. Setează num_comp = 2. Pachetele tidyverse și embed au fost deja încărcate pentru tine.
Acest exercițiu face parte din cursul
Reducerea dimensionalității în R
Instrucțiuni pentru exercițiu
- Antrenează UMAP pe toți predictorii din
house_sales_dffolosindstep_umap()într-un recipe și stochează datele transformate înumap_df. - Vizualizează dimensiunile UMAP folosind
ggplot(), codificând variabila țintăpriceprin culoare.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Fit UMAP
set.seed(1234)
umap_df <- ___(___ ~ ., data = ___) %>%
___(___()) %>%
___(___(), num_comp = 2) %>%
prep() %>%
___()
# Plot UMAP
___ %>%
___(aes(x = ___, y = ___, color = ___)) +
___(alpha = 0.7) +
scale_color_gradient(low="gray", high="blue")