Kom igångKom igång gratis

Paketera imputering och modellering i en funktion

När du utför analyser eller modellering på imputerad data bör du ta hänsyn till den osäkerhet som imputeringen medför. Att köra en modell på en datamängd som imputerats bara en gång bortser från att imputering skattar de saknade värdena med viss osäkerhet. Standardfelen från en sådan modell tenderar att bli för små. Lösningen är multipel imputering, och ett sätt att implementera det är via bootstrapping.

I de kommande övningarna arbetar du med välbekanta biopics-data. Målet är att använda multipel imputering med bootstrapping och linjär regression för att undersöka om biografiska filmer med kvinnliga huvudpersoner genererar lägre intäkter än de med manliga – baserat på tillgängliga data.

Börja med att skriva en funktion som skapar ett bootstrapurval, imputerar det och anpassar en linjär regressionsmodell.

Den här övningen är en del av kursen

Hantering av saknade värden med imputering i R

Visa kurs

Övningsinstruktioner

  • Dela upp data för att sampla om rader som anges av indices och tilldela resultatet till data_boot.
  • Imputera bootstrapurvalet data_boot med kNN-imputering med 5 grannar och tilldela resultatet till data_imp.
  • Anpassa en linjär regressionsmodell till data_imp som förklarar earnings med hjälp av sub_sex, sub_type och year.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

calc_gender_coef <- function(data, indices) {
  # Get bootstrap sample
  data_boot <- data[___, ]
  # Impute with kNN imputation
  data_imp <- ___
  # Fit linear regression
  linear_model <- ___
  # Extract and return gender coefficient
  gender_coefficient <- coef(linear_model)[2]
  return(gender_coefficient)
}
Redigera och kör kod