Alegerea numărului de vecini
Imputarea k-Nearest-Neighbors (sau kNN) completează valorile lipsă dintr-o observație pe baza valorilor provenite din celelalte k observații cele mai similare cu ea. Numărul acestor observații similare, numite vecini, care sunt luate în considerare este un parametru ce trebuie ales în prealabil.
Cum alegi k? O modalitate este să încerci valori diferite și să observi cum influențează relațiile dintre datele imputate și cele observate.
Hai să imputăm humidity în setul de date tao folosind trei valori diferite pentru k și să vedem cum se potrivesc valorile imputate cu relația dintre humidity și sea_surface_temp.
Acest exercițiu face parte din cursul
Gestionarea datelor lipsă prin imputare în R
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Impute humidity using 30 neighbors
tao_imp <- ___(tao, k = ___, variable = ___)
# Draw a margin plot of sea_surface_temp vs humidity
tao_imp %>%
select(sea_surface_temp, humidity, humidity_imp) %>%
___(delimiter = "imp", main = "k = 30")