Začněte nyníZačněte zdarma

Triky a tipy pro hot-deck imputaci II: řazení podle korelovaných proměnných

Dalším trikem, který může zlepšit výkon hot-deck imputace, je seřazení dat podle proměnných korelovaných s tou, kterou chceme imputovat.

Například ve všech margin plotech, které jsi nedávno vykresloval/a, jsi viděl/a, že teplota vzduchu silně koreluje s teplotou mořského povrchu — a to dává velký smysl. Tuto znalost můžeš využít ke zlepšení hot-deck imputace. Pokud data nejprve seřadíš podle sea_surface_temp, každá imputovaná hodnota air_temp bude pocházet od dárce s podobnou hodnotou sea_surface_temp. Pojďme se podívat, jak to funguje!

Toto cvičení je součástí kurzu

Práce s chybějícími daty pomocí imputace v R

Zobrazit kurz

Pokyny k cvičení

  • Proveď hot-deck imputaci chybějících hodnot v air_temp v datasetu tao, seřaď data podle sea_surface_temp a výsledek ulož do tao_imp.
  • Vytvoř margin plot proměnných air_temp a sea_surface_temp.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Hot-deck-impute air_temp in tao ordering by sea_surface_temp
tao_imp <- ___(___, ___ = ___, ___ = ___)

# Draw a margin plot of air_temp vs sea_surface_temp
tao_imp %>% 
	select(air_temp, sea_surface_temp, air_temp_imp) %>% 
	___(___ = ___)
Upravit a spustit kód