Методи фільтрації та обгортки
Питання про зменшення розмірності набору даних дуже поширені на співбесідах з машинного навчання. Один зі способів зменшити розмірність — обрати лише релевантні ознаки у вашому наборі даних.
Тут ви попрактикуєте метод фільтрації на датафреймі diabetes, а потім 2 різні стилі методів-обгорток, що включають перехресну перевірку. Ви використовуватимете pandas, matplotlib.pyplot та seaborn, щоб візуалізувати кореляції, обробити дані та застосувати методи відбору ознак до вашого набору даних.
Матриця ознак без цільового стовпця (progression) завантажена як X, а цільова змінна — як y.
Зверніть увагу, що pandas, matplotlib.pyplot і seaborn уже імпортовано у ваш робочий простір з псевдонімами pd, plt і sns відповідно.
Зверніть увагу, що ви додали крок Cross-validate до свого конвеєра (він стосується останніх 3 кроків):

Ця вправа є частиною курсу
Практика співбесід з Machine Learning у Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create correlation matrix and print it
cor = ____.____()
print(____)
# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()
# Correlation with output variable
cor_target = abs(cor["progression"])
# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)