Разделение цен на жильё с помощью t-SNE
t-SNE — это нелинейный метод снижения размерности. Он преобразует многомерные данные в пространство меньшей размерности, стремясь при этом сохранить расположение точек относительно их ближайших соседей. Вы создадите график t-SNE и сравните его с графиком PCA из предыдущего упражнения. PCA сохраняет глобальную структуру данных, но не локальную. t-SNE, напротив, сохраняет локальную структуру: точки, которые были соседями в многомерном пространстве, остаются близкими друг к другу и в пространстве меньшей размерности. Это различие наглядно проявится на графиках.
Вы применёте t-SNE для снижения размерности набора данных house_sales_df. Целевая переменная в house_sales_df — это price. Пакеты tidyverse и Rtsne уже загружены.
Это упражнение является частью курса
Снижение размерности в R
Инструкции к упражнению
- Обучите t-SNE на наборе данных
house_sales_dfс помощью функцииRtsne(). - Присоедините координаты X и Y, полученные методом t-SNE, к
house_sales_df. - Постройте график результатов t-SNE с помощью
ggplot(), отобразив целевую переменную через цвет.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Fit t-SNE
set.seed(1234)
tsne <- ___(___ %>% select(-___), check_duplicates = FALSE)
# Bind t-SNE coordinates to the data frame
tsne_df <- ___ %>%
___(tsne_x = ___$___[,___], tsne_y = ___$___[,___])
# Plot t-SNE
___ %>%
___(aes(x = ___, y = ___, color = ___)) +
geom_point() +
scale_color_gradient(low="gray", high="blue")