ÎncepețiÎncepe gratuit

Împachetarea imputării și modelării într-o funcție

Ori de câte ori efectuezi o analiză sau construiești un model pe date imputate, trebuie să ții cont de incertitudinea din imputare. Rularea unui model pe un set de date imputat o singură dată ignoră faptul că imputarea estimează valorile lipsă cu un anumit grad de incertitudine. Erorile standard dintr-un astfel de model tind să fie prea mici. Soluția este imputarea multiplă, iar una dintre modalitățile de implementare este prin bootstrapping.

În exercițiile următoare, vei lucra cu datele cunoscute biopics. Scopul este să folosești imputarea multiplă prin bootstrapping și regresia liniară pentru a vedea dacă, pe baza datelor disponibile, filmele biografice cu protagoniste de gen feminin generează venituri mai mici decât cele despre bărbați.

Hai să începem prin a scrie o funcție care creează un eșantion bootstrap, îl imputează și antrenează un model de regresie liniară.

Acest exercițiu face parte din cursul

Gestionarea datelor lipsă prin imputare în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Selectează din data rândurile indicate de indices pentru a crea un nou eșantion și atribuie rezultatul variabilei data_boot.
  • Imputează eșantionul bootstrap data_boot folosind imputarea kNN cu 5 vecini și atribuie rezultatul variabilei data_imp.
  • Antrenează un model de regresie liniară pe data_imp care să explice earnings prin sub_sex, sub_type și year.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

calc_gender_coef <- function(data, indices) {
  # Get bootstrap sample
  data_boot <- data[___, ]
  # Impute with kNN imputation
  data_imp <- ___
  # Fit linear regression
  linear_model <- ___
  # Extract and return gender coefficient
  gender_coefficient <- coef(linear_model)[2]
  return(gender_coefficient)
}
Editează și rulează codul