始める無料で始める

フィルター法とラッパー法

Machine Learning の面接では、データセットの次元削減に関する質問がとてもよく出題されます。次元を減らす1つの方法は、データセットから関連する特徴量だけを選ぶことです。

ここでは、diabetes データフレームに対してフィルター法を実践し、その後にクロスバリデーションを含む2種類のラッパー法を行います。相関の可視化、データ処理、特徴量選択の適用には、pandasmatplotlib.pyplotseaborn を使います。

目的変数列(progression)を落とした特徴量行列は X、目的変数は y として読み込まれています。

なお、pandasmatplotlib.pyplotseaborn はそれぞれ pdpltsns のエイリアスでワークスペースにすでにインポート済みです。

パイプラインに最後の3ステップに適用される Cross-validate ステップを追加している点に注意してください。

Machine learning pipeline

この演習はコースの一部です

Pythonで学ぶMachine Learning面接対策

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create correlation matrix and print it
cor = ____.____()
print(____)

# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()

# Correlation with output variable
cor_target = abs(cor["progression"])

# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)
コードを編集して実行