НачатьНачать бесплатно

Разделение цен на жильё с помощью t-SNE

t-SNE — это нелинейный метод снижения размерности. Он преобразует многомерные данные в пространство меньшей размерности, стремясь при этом сохранить расположение точек относительно их ближайших соседей. Вы создадите график t-SNE и сравните его с графиком PCA из предыдущего упражнения. PCA сохраняет глобальную структуру данных, но не локальную. t-SNE, напротив, сохраняет локальную структуру: точки, которые были соседями в многомерном пространстве, остаются близкими друг к другу и в пространстве меньшей размерности. Это различие наглядно проявится на графиках.

Вы применёте t-SNE для снижения размерности набора данных house_sales_df. Целевая переменная в house_sales_df — это price. Пакеты tidyverse и Rtsne уже загружены.

Это упражнение является частью курса

Снижение размерности в R

Посмотреть курс

Инструкции к упражнению

  • Обучите t-SNE на наборе данных house_sales_df с помощью функции Rtsne().
  • Присоедините координаты X и Y, полученные методом t-SNE, к house_sales_df.
  • Постройте график результатов t-SNE с помощью ggplot(), отобразив целевую переменную через цвет.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Fit t-SNE
set.seed(1234)
tsne <- ___(___ %>% select(-___), check_duplicates = FALSE)

# Bind t-SNE coordinates to the data frame
tsne_df <- ___ %>% 
  ___(tsne_x = ___$___[,___], tsne_y = ___$___[,___])

# Plot t-SNE
___ %>% 
  ___(aes(x = ___, y = ___, color = ___)) +
  geom_point() +
  scale_color_gradient(low="gray", high="blue")
Редактировать и запускать код