スクリープロットで主成分を可視化する
Machine Learning の面接では、保持すべき最適な特徴量の数をどう決めるか尋ねられることがあります。ここでは、loan_data に PCA を適用し、主成分のスクリープロットと累積寄与率のプロットを作成します。
これにより、より高精度な ML モデルを学習するうえで最適な主成分(PCs)の数を判断しやすくなります。
PCA は教師なし手法なので、目的変数 Loan Status をデータセットから除外した X 行列に対して主成分分析を行います。n_components を設定しない場合、学習済みモデルから得られるすべての主成分が返されます。
この演習はコースの一部です
Pythonで学ぶMachine Learning面接対策
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Remove target variable
X = loan_data.____('____', axis=1)
# Instantiate
pca = ____(n_components=____)
# Fit and transform
principalComponents = pca.____(____)