始める無料で始める

多重共線性の対処法 - 特徴量エンジニアリング

多重共線性は、Machine Learning のあらゆる場面でパフォーマンスに影響する一般的な課題です。この小さなポイントを自信を持って語れると、モデリングの説明がぐっと洗練され、面接でも差がつきます。

この演習では、diabetes データセットに対して Linear Regression を使ったベースラインモデルを作り、いくつかの出力指標を確認します。次に、独立変数同士の相関を可視化して探る方法を練習し、最後に高い相関を持つ2つの変数に対して特徴量エンジニアリングを行います。

最初の2ステップでは、ワークスペースに読み込まれている X_trainX_testy_trainy_test を使用してください。

また、必要なパッケージはすべてインポート済みです: pandaspdsklearn.model_selection から train_test_splitsklearn.linear_model から LinearRegressionsklearn.metrics から mean_squared_errorr2_scorematplotlib.pyplotpltseabornsns です。

この演習はコースの一部です

Pythonで学ぶMachine Learning面接対策

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)

# Coefficient estimates
print('Coefficients: \n', lin_mod.____)

# Mean squared error
print("Mean squared error: %.2f"
      % ____(____, ____))

# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))
コードを編集して実行