ПочатиПочніть безкоштовно

Методи роботи з мультиколінеарністю — конструювання ознак

Мультиколінеарність — поширена проблема, яка може впливати на якість моделей у будь-якому контексті машинного навчання. Уміння грамотно пояснити цю деталь може піднести ваше обґрунтування моделювання з доброго до відмінного та справді вирізнити вас на співбесіді.

У цій вправі ви потренуєтеся створювати базову модель за допомогою лінійної регресії на наборі даних diabetes і досліджувати деякі з вихідних метрик. Потім ви попрактикуєте прийоми візуального дослідження кореляції між незалежними змінними, а на завершення виконаєте конструювання ознак для 2 змінних із високою кореляцією.

Для перших двох кроків використайте X_train, X_test, y_train і y_test, які вже імпортовано у ваш робочий простір.

Крім того, усі потрібні пакети вже імпортовано для вас: pandas як pd, train_test_split з sklearn.model_selection, LinearRegression з sklearn.linear_model, mean_squared_error і r2_score з sklearn.metrics, matplotlib.pyplot як plt та seaborn як sns.

Ця вправа є частиною курсу

Практика співбесід з Machine Learning у Python

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)

# Coefficient estimates
print('Coefficients: \n', lin_mod.____)

# Mean squared error
print("Mean squared error: %.2f"
      % ____(____, ____))

# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))
Редагувати та запускати код