相関のある予測変数を見つける
相関の高い予測変数は重複した情報を含み、モデルの学習に悪影響を与えることがあります。2つの変数が強く相関していると、それらの値は互いに線形に変化し、Machine Learning アルゴリズムに同じ情報を提供してしまいます。この現象は多重共線性と呼ばれます。
モデルの学習を始める前に、データセットを探索してこれらの関係を見つけ、特徴量エンジニアリングの段階で取り除くことが重要です。
この演習では、telecom_training データセットの数値予測変数すべてについて相関行列を作成して探索します。
telecom_training データはすでにセッションに読み込まれています。
この演習はコースの一部です
R での tidymodels によるモデリング
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
telecom_training %>%
# Select numeric columns
___(___) %>%
# Calculate correlation matrix
___