НачатьНачать бесплатно

Разделение цен на жильё с помощью UMAP

Вы уже уменьшали размерность данных о продажах жилья в Калифорнии (house_sales_df) с помощью PCA и t-SNE. Теперь попробуем применить UMAP. Результат UMAP во многом схож с результатом t-SNE, однако UMAP, как правило, более эффективен с вычислительной точки зрения. Кроме того, он лучше сохраняет глобальную структуру данных. На практике это означает, что расстояние между кластерами можно интерпретировать как меру схожести — чего нельзя было сделать в случае t-SNE.

Напомним: целевая переменная в house_sales_df — это price. Задайте num_comp = 2. Пакеты tidyverse и embed уже загружены.

Это упражнение является частью курса

Снижение размерности в R

Посмотреть курс

Инструкции к упражнению

  • Примените UMAP ко всем предикторам в house_sales_df с помощью step_umap() в рецепте и сохраните преобразованные данные в umap_df.
  • Постройте график измерений UMAP с помощью ggplot(), закодировав целевую переменную price цветом.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Fit UMAP
set.seed(1234)
umap_df <- ___(___ ~ ., data = ___) %>% 
  ___(___()) %>% 
  ___(___(), num_comp = 2) %>% 
  prep() %>% 
  ___() 

# Plot UMAP
___ %>%  
  ___(aes(x = ___, y = ___, color = ___)) +
  ___(alpha = 0.7) +
  scale_color_gradient(low="gray", high="blue")
Редактировать и запускать код