Chyby imputace pro jednotlivé proměnné
V předchozím cvičení jsi z výstupu missForest extrahoval/a odhadnuté chyby imputace. Výsledkem byla dvě čísla:
- normalizovaná odmocnina střední čtvercové chyby (NRMSE) pro všechny spojité proměnné;
- podíl chybně zařazených hodnot (PFC) pro všechny kategorické proměnné.
Může se ale stát, že imputační model funguje skvěle pro jednu spojitou proměnnou a špatně pro jinou! Abys takové případy odhalil/a, stačí nastavit missForest tak, aby počítal chyby zvlášť pro každou proměnnou. To zajistíš nastavením argumentu variablewise na TRUE.
Data biopics a balíček missForest jsou už načtené, takže se pojďme blíže podívat na chyby!
Toto cvičení je součástí kurzu
Práce s chybějícími daty pomocí imputace v R
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Impute biopics data with missForest computing per-variable errors
imp_res <- ___(___, ___ = ___)