НачатьНачать бесплатно

Методы борьбы с мультиколлинеарностью — разработка признаков

Мультиколлинеарность — распространённая проблема, которая может негативно влиять на качество любой модели машинного обучения. Умение грамотно объяснить этот нюанс способно вывести ваш рассказ о моделировании на новый уровень и выгодно выделить вас на собеседовании.

В этом упражнении вы построите базовую модель с помощью линейной регрессии на наборе данных diabetes и изучите основные метрики качества. Затем вы применили методы визуального исследования корреляции между независимыми переменными, а после — выполните разработку признаков для двух переменных с высокой взаимной корреляцией.

Для первых двух шагов используйте X_train, X_test, y_train и y_test, которые уже загружены в рабочее пространство.

Все необходимые пакеты также импортированы: pandas как pd, train_test_split из sklearn.model_selection, LinearRegression из sklearn.linear_model, mean_squared_error и r2_score из sklearn.metrics, matplotlib.pyplot как plt и seaborn как sns.

Это упражнение является частью курса

Практика вопросов интервью по машинному обучению на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)

# Coefficient estimates
print('Coefficients: \n', lin_mod.____)

# Mean squared error
print("Mean squared error: %.2f"
      % ____(____, ____))

# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))
Редактировать и запускать код