Začněte nyníZačněte zdarma

Dimenzionalita a informační obsah příznaků

Představ si, že pracuješ v bance a máš k dispozici informace o různých půjčkách poskytnutých různým lidem. Tvůj nadřízený tě požádal, abys začal/a zkoumat možnost využít tato data ke klasifikaci zákazníků do různých kategorií kreditního skóre. Ukázka dostupných dat je načtena do credit_df. Zajímá tě, kolik příznaků data obsahují, a chceš také identifikovat příznaky, které pro klasifikaci zákazníků nebudou užitečné.

Balíček tidyverse je pro tebe již načtený.

Toto cvičení je součástí kurzu

Redukce dimenzionality v R

Zobrazit kurz

Pokyny k cvičení

  • Zjisti počet příznaků v credit_df.
  • Vypočítej rozptyl každého příznaku v credit_df.
  • Identifikuj příznak s nulovým rozptylem a přiřaď ho do column_to_remove.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Find the number of features
___ %>% ___()

# Compute each column variance
credit_df %>% 
  ___(___(___(), ~ ___(., na.rm = TRUE))) %>% 
  pivot_longer(everything(), names_to = "feature", values_to = "variance")

# Assign the zero-variance column
column_to_remove <- "___"
Upravit a spustit kód