Împachetarea imputării și modelării într-o funcție
Ori de câte ori efectuezi o analiză sau construiești un model pe date imputate, trebuie să ții cont de incertitudinea din imputare. Rularea unui model pe un set de date imputat o singură dată ignoră faptul că imputarea estimează valorile lipsă cu un anumit grad de incertitudine. Erorile standard dintr-un astfel de model tind să fie prea mici. Soluția este imputarea multiplă, iar una dintre modalitățile de implementare este prin bootstrapping.
În exercițiile următoare, vei lucra cu datele cunoscute biopics. Scopul este să folosești imputarea multiplă prin bootstrapping și regresia liniară pentru a vedea dacă, pe baza datelor disponibile, filmele biografice cu protagoniste de gen feminin generează venituri mai mici decât cele despre bărbați.
Hai să începem prin a scrie o funcție care creează un eșantion bootstrap, îl imputează și antrenează un model de regresie liniară.
Acest exercițiu face parte din cursul
Gestionarea datelor lipsă prin imputare în R
Instrucțiuni pentru exercițiu
- Selectează din
datarândurile indicate deindicespentru a crea un nou eșantion și atribuie rezultatul variabileidata_boot. - Imputează eșantionul bootstrap
data_bootfolosind imputarea kNN cu 5 vecini și atribuie rezultatul variabileidata_imp. - Antrenează un model de regresie liniară pe
data_impcare să expliceearningsprinsub_sex,sub_typeșiyear.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
calc_gender_coef <- function(data, indices) {
# Get bootstrap sample
data_boot <- data[___, ]
# Impute with kNN imputation
data_imp <- ___
# Fit linear regression
linear_model <- ___
# Extract and return gender coefficient
gender_coefficient <- coef(linear_model)[2]
return(gender_coefficient)
}