Dimenzionalita a informační obsah příznaků
Představ si, že pracuješ v bance a máš k dispozici informace o různých půjčkách poskytnutých různým lidem. Tvůj nadřízený tě požádal, abys začal/a zkoumat možnost využít tato data ke klasifikaci zákazníků do různých kategorií kreditního skóre. Ukázka dostupných dat je načtena do credit_df. Zajímá tě, kolik příznaků data obsahují, a chceš také identifikovat příznaky, které pro klasifikaci zákazníků nebudou užitečné.
Balíček tidyverse je pro tebe již načtený.
Toto cvičení je součástí kurzu
Redukce dimenzionality v R
Pokyny k cvičení
- Zjisti počet příznaků v
credit_df. - Vypočítej rozptyl každého příznaku v
credit_df. - Identifikuj příznak s nulovým rozptylem a přiřaď ho do
column_to_remove.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Find the number of features
___ %>% ___()
# Compute each column variance
credit_df %>%
___(___(___(), ~ ___(., na.rm = TRUE))) %>%
pivot_longer(everything(), names_to = "feature", values_to = "variance")
# Assign the zero-variance column
column_to_remove <- "___"