フィルター法とラッパー法
Machine Learning の面接では、データセットの次元削減に関する質問がとてもよく出題されます。次元を減らす1つの方法は、データセットから関連する特徴量だけを選ぶことです。
ここでは、diabetes データフレームに対してフィルター法を実践し、その後にクロスバリデーションを含む2種類のラッパー法を行います。相関の可視化、データ処理、特徴量選択の適用には、pandas、matplotlib.pyplot、seaborn を使います。
目的変数列(progression)を落とした特徴量行列は X、目的変数は y として読み込まれています。
なお、pandas、matplotlib.pyplot、seaborn はそれぞれ pd、plt、sns のエイリアスでワークスペースにすでにインポート済みです。
パイプラインに最後の3ステップに適用される Cross-validate ステップを追加している点に注意してください。

この演習はコースの一部です
Pythonで学ぶMachine Learning面接対策
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create correlation matrix and print it
cor = ____.____()
print(____)
# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()
# Correlation with output variable
cor_target = abs(cor["progression"])
# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)