Методы фильтрации и обёртки
Вопросы о снижении размерности набора данных очень часто встречаются на собеседованиях по машинному обучению. Один из способов снизить размерность — отобрать только значимые признаки.
В этом упражнении вы применяете метод фильтрации к датафрейму diabetes, а затем два разных метода обёртки с перекрёстной проверкой. Для визуализации корреляций, обработки данных и отбора признаков вы будете использовать pandas, matplotlib.pyplot и seaborn.
Матрица признаков с удалённым столбцом целевой переменной (progression) загружена как X, а сама целевая переменная — как y.
Обратите внимание: pandas, matplotlib.pyplot и seaborn уже импортированы в рабочее пространство и доступны под псевдонимами pd, plt и sns соответственно.
В конвейер добавлен шаг Cross-validate (он применяется к последним 3 шагам):

Это упражнение является частью курса
Практика вопросов интервью по машинному обучению на Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create correlation matrix and print it
cor = ____.____()
print(____)
# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()
# Correlation with output variable
cor_target = abs(cor["progression"])
# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)