Методы борьбы с мультиколлинеарностью — разработка признаков
Мультиколлинеарность — распространённая проблема, которая может негативно влиять на качество любой модели машинного обучения. Умение грамотно объяснить этот нюанс способно вывести ваш рассказ о моделировании на новый уровень и выгодно выделить вас на собеседовании.
В этом упражнении вы построите базовую модель с помощью линейной регрессии на наборе данных diabetes и изучите основные метрики качества. Затем вы применили методы визуального исследования корреляции между независимыми переменными, а после — выполните разработку признаков для двух переменных с высокой взаимной корреляцией.
Для первых двух шагов используйте X_train, X_test, y_train и y_test, которые уже загружены в рабочее пространство.
Все необходимые пакеты также импортированы:
pandas как pd, train_test_split из sklearn.model_selection, LinearRegression из sklearn.linear_model, mean_squared_error и r2_score из sklearn.metrics, matplotlib.pyplot как plt и seaborn как sns.
Это упражнение является частью курса
Практика вопросов интервью по машинному обучению на Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)
# Coefficient estimates
print('Coefficients: \n', lin_mod.____)
# Mean squared error
print("Mean squared error: %.2f"
% ____(____, ____))
# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))