多重共线性方法——特征工程
多重共线性是在任何机器学习场景中都可能影响模型表现的常见问题。若能清楚讨论这一细节,您的建模讲解就能从合格走向优秀,并在面试中脱颖而出。
在本练习中,您将先在 diabetes 数据集上使用线性回归(Linear Regression)创建一个基线模型,并查看部分输出指标。随后,您将练习用可视化方法探索自变量之间的相关性,最后对两个人工高度相关的变量进行特征工程。
在前两个步骤中,请使用已导入到工作区的 X_train、X_test、y_train 和 y_test。
此外,所有相关包已为您导入:
pandas 作为 pd,来自 sklearn.model_selection 的 train_test_split,来自 sklearn.linear_model 的 LinearRegression,来自 sklearn.metrics 的 mean_squared_error 与 r2_score,matplotlib.pyplot 作为 plt,以及 seaborn 作为 sns。
本练习是课程的一部分
用 Python 练习机器学习面试题
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)
# Coefficient estimates
print('Coefficients: \n', lin_mod.____)
# Mean squared error
print("Mean squared error: %.2f"
% ____(____, ____))
# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))