Metody filter a wrapper
Otázky týkající se snižování dimenzionality datasetu patří na pohovorech z oblasti strojového učení k těm nejčastějším. Jedním ze způsobů, jak dimenzi datasetu snížit, je ponechat pouze relevantní příznaky.
Tady si procvičíš metodu filter na DataFrame diabetes a následně 2 různé styly metod wrapper zahrnující křížovou validaci. Pro vizualizaci korelací, zpracování dat a aplikaci technik výběru příznaků použiješ pandas, matplotlib.pyplot a seaborn.
Matice příznaků s odstraněným sloupcem cílové proměnné (progression) je načtena jako X, samotná cílová proměnná pak jako y.
Poznámka: pandas, matplotlib.pyplot a seaborn jsou již v pracovním prostředí importovány a dostupné pod aliasy pd, plt a sns.
Všimni si, že do pipeline přibyl krok Cross-validate (který se vztahuje na poslední 3 kroky):

Toto cvičení je součástí kurzu
Procvičování otázek k pohovorům z oblasti Machine Learning v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create correlation matrix and print it
cor = ____.____()
print(____)
# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()
# Correlation with output variable
cor_target = abs(cor["progression"])
# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)