상관성이 높은 특성 식별하기
house_sales_df 데이터를 사용해 상관계수가 높은 특성을 식별하는 연습을 해봅니다. 특성 간 상관이 높다는 것은 정보가 중복될 가능성이 크며, 회귀 모델에서 다중공선성과 같은 모델링 문제를 유발할 수 있습니다. 상관성이 높은 특성 중 어떤 것을 제거할지 결정해 보세요. 상관행렬은 상관성이 높은 특성을 찾는 데 도움을 줍니다.
tidyverse와 corrr 패키지는 미리 로드되어 있습니다.
이 연습은 강의의 일부입니다
R에서의 차원 축소
연습 안내
- 플롯 위에 상관계수 값이 표시되도록 상관 플롯을 만드세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create a correlation plot of the house sales
house_sales_df %>%
___() %>%
___() %>%
___(print_cor = ___) +
theme(axis.text.x = element_text(angle = 90, hjust = 1))