強く相関している特徴量を見つける
house_sales_df のデータを使って、相関が高い特徴量を特定する練習をします。特徴量間の相関が高い場合、情報が重複している可能性があり、回帰モデルにおける多重共線性など、モデリングで問題を引き起こすことがあります。相関が高い特徴量のうち、どれを削除するかを判断しましょう。相関行列は、相関の高い特徴量を見つけるのに役立ちます。
tidyverse と corrr パッケージはすでに読み込まれています。
この演習はコースの一部です
Rによる次元削減
演習の手順
- 相関係数を数値として表示した相関プロットを作成してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create a correlation plot of the house sales
house_sales_df %>%
___() %>%
___() %>%
___(print_cor = ___) +
theme(axis.text.x = element_text(angle = 90, hjust = 1))