Začněte nyníZačněte zdarma

Metody filter a wrapper

Otázky týkající se snižování dimenzionality datasetu patří na pohovorech z oblasti strojového učení k těm nejčastějším. Jedním ze způsobů, jak dimenzi datasetu snížit, je ponechat pouze relevantní příznaky.

Tady si procvičíš metodu filter na DataFrame diabetes a následně 2 různé styly metod wrapper zahrnující křížovou validaci. Pro vizualizaci korelací, zpracování dat a aplikaci technik výběru příznaků použiješ pandas, matplotlib.pyplot a seaborn.

Matice příznaků s odstraněným sloupcem cílové proměnné (progression) je načtena jako X, samotná cílová proměnná pak jako y.

Poznámka: pandas, matplotlib.pyplot a seaborn jsou již v pracovním prostředí importovány a dostupné pod aliasy pd, plt a sns.

Všimni si, že do pipeline přibyl krok Cross-validate (který se vztahuje na poslední 3 kroky):

Machine learning pipeline

Toto cvičení je součástí kurzu

Procvičování otázek k pohovorům z oblasti Machine Learning v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create correlation matrix and print it
cor = ____.____()
print(____)

# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()

# Correlation with output variable
cor_target = abs(cor["progression"])

# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)
Upravit a spustit kód