多重共線性の対処法 - 特徴量エンジニアリング
多重共線性は、Machine Learning のあらゆる場面でパフォーマンスに影響する一般的な課題です。この小さなポイントを自信を持って語れると、モデリングの説明がぐっと洗練され、面接でも差がつきます。
この演習では、diabetes データセットに対して Linear Regression を使ったベースラインモデルを作り、いくつかの出力指標を確認します。次に、独立変数同士の相関を可視化して探る方法を練習し、最後に高い相関を持つ2つの変数に対して特徴量エンジニアリングを行います。
最初の2ステップでは、ワークスペースに読み込まれている X_train、X_test、y_train、y_test を使用してください。
また、必要なパッケージはすべてインポート済みです:
pandas は pd、sklearn.model_selection から train_test_split、sklearn.linear_model から LinearRegression、sklearn.metrics から mean_squared_error と r2_score、matplotlib.pyplot は plt、seaborn は sns です。
この演習はコースの一部です
Pythonで学ぶMachine Learning面接対策
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)
# Coefficient estimates
print('Coefficients: \n', lin_mod.____)
# Mean squared error
print("Mean squared error: %.2f"
% ____(____, ____))
# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))