Tipy a triky pro kNN I: vážení donorů
Oblíbenou variantou kNN imputace je takzvaná agregace vážená vzdáleností. To znamená, že při agregaci hodnot od sousedů — za účelem nahrazení chybějící hodnoty — používáme vážený průměr, přičemž váhy odpovídají invertovaným vzdálenostem od jednotlivých sousedů. Bližší sousedé tak mají na imputovanou hodnotu větší vliv.
V tomto cvičení použiješ agregaci váženou vzdáleností při imputaci dat tao. Stačí funkci kNN() předat dva dodatečné argumenty. Pojďme na to!
Toto cvičení je součástí kurzu
Práce s chybějícími daty pomocí imputace v R
Pokyny k cvičení
- Načti balíček
VIM. - Imputuj
humiditypomocí kNN s použitím vzdálenostně váženého průměru pro agregaci sousedů; zadej argumentynumFunaweightDist. - Kód pro vykreslení marginálního grafu výsledků je již připravený.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load the VIM package
___(___)
# Impute humidity with kNN using distance-weighted mean
tao_imp <- ___(tao,
k = 5,
variable = "humidity",
___ = ___,
___ = ___)
tao_imp %>%
select(sea_surface_temp, humidity, humidity_imp) %>%
marginplot(delimiter = "imp")