Методи роботи з мультиколінеарністю — конструювання ознак
Мультиколінеарність — поширена проблема, яка може впливати на якість моделей у будь-якому контексті машинного навчання. Уміння грамотно пояснити цю деталь може піднести ваше обґрунтування моделювання з доброго до відмінного та справді вирізнити вас на співбесіді.
У цій вправі ви потренуєтеся створювати базову модель за допомогою лінійної регресії на наборі даних diabetes і досліджувати деякі з вихідних метрик. Потім ви попрактикуєте прийоми візуального дослідження кореляції між незалежними змінними, а на завершення виконаєте конструювання ознак для 2 змінних із високою кореляцією.
Для перших двох кроків використайте X_train, X_test, y_train і y_test, які вже імпортовано у ваш робочий простір.
Крім того, усі потрібні пакети вже імпортовано для вас:
pandas як pd, train_test_split з sklearn.model_selection, LinearRegression з sklearn.linear_model, mean_squared_error і r2_score з sklearn.metrics, matplotlib.pyplot як plt та seaborn як sns.
Ця вправа є частиною курсу
Практика співбесід з Machine Learning у Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)
# Coefficient estimates
print('Coefficients: \n', lin_mod.____)
# Mean squared error
print("Mean squared error: %.2f"
% ____(____, ____))
# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))