Práce s chybějícími daty
Některým potenciálním dárcům chybí data o věku (age). R bohužel při sestavování regresního modelu vyřadí všechny záznamy s hodnotami NA.
Jedním ze způsobů, jak to obejít, je nahradit chybějící hodnoty odhadnutou hodnotou – tento postup se nazývá imputace. Poté můžeš také vytvořit indikátor chybějících dat, který zohlední možnost, že záznamy s chybějícími hodnotami se nějakým způsobem liší od těch bez nich.
Dataový rámec donors je načtený ve tvém pracovním prostoru.
Toto cvičení je součástí kurzu
Supervised Learning v R: Klasifikace
Pokyny k cvičení
- Použij
summary()nadonors$agea zjisti průměrný věk uchazečů s dostupnými daty. - Pomocí
ifelse()a testuis.na(donors$age)imputuj průměrný věk (zaokrouhlený na 2 desetinná místa) pro záznamy s chybějícímage. Nezapomeň také ignorovat hodnotyNA. - Vytvoř binární dummy proměnnou s názvem
missing_age, která bude indikovat přítomnost chybějících dat – použij další voláníifelse()se stejným testem.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Find the average age among non-missing values
summary(___)
# Impute missing age values with the mean age
donors$imputed_age <- ifelse(___)
# Create missing value indicator for age
donors$missing_age <- ___