Разделение цен на жильё с помощью UMAP
Вы уже уменьшали размерность данных о продажах жилья в Калифорнии (house_sales_df) с помощью PCA и t-SNE. Теперь попробуем применить UMAP. Результат UMAP во многом схож с результатом t-SNE, однако UMAP, как правило, более эффективен с вычислительной точки зрения. Кроме того, он лучше сохраняет глобальную структуру данных. На практике это означает, что расстояние между кластерами можно интерпретировать как меру схожести — чего нельзя было сделать в случае t-SNE.
Напомним: целевая переменная в house_sales_df — это price. Задайте num_comp = 2. Пакеты tidyverse и embed уже загружены.
Это упражнение является частью курса
Снижение размерности в R
Инструкции к упражнению
- Примените UMAP ко всем предикторам в
house_sales_dfс помощьюstep_umap()в рецепте и сохраните преобразованные данные вumap_df. - Постройте график измерений UMAP с помощью
ggplot(), закодировав целевую переменнуюpriceцветом.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Fit UMAP
set.seed(1234)
umap_df <- ___(___ ~ ., data = ___) %>%
___(___()) %>%
___(___(), num_comp = 2) %>%
prep() %>%
___()
# Plot UMAP
___ %>%
___(aes(x = ___, y = ___, color = ___)) +
___(alpha = 0.7) +
scale_color_gradient(low="gray", high="blue")