多重共線性への対処法 - PCA
前の演習では、diabetes データセットで最も高い相関を示した独立変数 s1 と s2 を、特徴量エンジニアリングで s1_s2 に結合しました。
この演習では、Linear Regression を適用する前に、diabetes に対して PCA を実行して多重共線性を取り除きます。次に、その出力指標を前の演習の結果と比較します。最後に、PCA により多重共線性が完全に除去されることを踏まえ、データセットの相関行列とヒートマップがどのように見えるかを可視化します。
この演習はコースの一部です
Pythonで学ぶMachine Learning面接対策
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import
from sklearn.decomposition import ____
# Instantiate
pca = ____()
# Fit on train
pca.____(____)
# Transform train and test
X_trainPCA = pca.____(____)
X_testPCA = pca.____(____)