Triky a tipy pro hot-deck imputaci II: řazení podle korelovaných proměnných
Dalším trikem, který může zlepšit výkon hot-deck imputace, je seřazení dat podle proměnných korelovaných s tou, kterou chceme imputovat.
Například ve všech margin plotech, které jsi nedávno vykresloval/a, jsi viděl/a, že teplota vzduchu silně koreluje s teplotou mořského povrchu — a to dává velký smysl. Tuto znalost můžeš využít ke zlepšení hot-deck imputace. Pokud data nejprve seřadíš podle sea_surface_temp, každá imputovaná hodnota air_temp bude pocházet od dárce s podobnou hodnotou sea_surface_temp. Pojďme se podívat, jak to funguje!
Toto cvičení je součástí kurzu
Práce s chybějícími daty pomocí imputace v R
Pokyny k cvičení
- Proveď hot-deck imputaci chybějících hodnot v
air_tempv datasetutao, seřaď data podlesea_surface_tempa výsledek ulož dotao_imp. - Vytvoř margin plot proměnných
air_tempasea_surface_temp.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Hot-deck-impute air_temp in tao ordering by sea_surface_temp
tao_imp <- ___(___, ___ = ___, ___ = ___)
# Draw a margin plot of air_temp vs sea_surface_temp
tao_imp %>%
select(air_temp, sea_surface_temp, air_temp_imp) %>%
___(___ = ___)