ÎncepețiÎncepe gratuit

Trucuri și sfaturi pentru kNN I: ponderarea donatorilor

O variantă a imputării kNN, frecvent utilizată, se bazează pe agregarea ponderată prin distanță. Concret, atunci când agregăm valorile vecinilor pentru a obține un înlocuitor pentru o valoare lipsă, folosim media ponderată, iar ponderile sunt distanțele inversate față de fiecare vecin. Astfel, vecinii mai apropiați au un impact mai mare asupra valorii imputate.

În acest exercițiu, vei aplica agregarea ponderată prin distanță în timp ce imputezi datele tao. Vei avea nevoie doar să transmiți două argumente suplimentare funcției kNN(). Hai să încercăm!

Acest exercițiu face parte din cursul

Gestionarea datelor lipsă prin imputare în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Încarcă pachetul VIM.
  • Imputează humidity cu kNN folosind media ponderată prin distanță pentru agregarea vecinilor; va trebui să specifici argumentele numFun și weightDist.
  • Graficul de marjă pentru vizualizarea rezultatelor a fost deja codificat pentru tine.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load the VIM package
___(___)

# Impute humidity with kNN using distance-weighted mean
tao_imp <- ___(tao, 
               k = 5, 
               variable = "humidity", 
               ___ = ___,
               ___ = ___)

tao_imp %>% 
	select(sea_surface_temp, humidity, humidity_imp) %>% 
	marginplot(delimiter = "imp")
Editează și rulează codul