Paketera imputering och modellering i en funktion
När du utför analyser eller modellering på imputerad data bör du ta hänsyn till den osäkerhet som imputeringen medför. Att köra en modell på en datamängd som imputerats bara en gång bortser från att imputering skattar de saknade värdena med viss osäkerhet. Standardfelen från en sådan modell tenderar att bli för små. Lösningen är multipel imputering, och ett sätt att implementera det är via bootstrapping.
I de kommande övningarna arbetar du med välbekanta biopics-data. Målet är att använda multipel imputering med bootstrapping och linjär regression för att undersöka om biografiska filmer med kvinnliga huvudpersoner genererar lägre intäkter än de med manliga – baserat på tillgängliga data.
Börja med att skriva en funktion som skapar ett bootstrapurval, imputerar det och anpassar en linjär regressionsmodell.
Den här övningen är en del av kursen
Hantering av saknade värden med imputering i R
Övningsinstruktioner
- Dela upp
dataför att sampla om rader som anges avindicesoch tilldela resultatet tilldata_boot. - Imputera bootstrapurvalet
data_bootmed kNN-imputering med 5 grannar och tilldela resultatet tilldata_imp. - Anpassa en linjär regressionsmodell till
data_impsom förklararearningsmed hjälp avsub_sex,sub_typeochyear.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
calc_gender_coef <- function(data, indices) {
# Get bootstrap sample
data_boot <- data[___, ]
# Impute with kNN imputation
data_imp <- ___
# Fit linear regression
linear_model <- ___
# Extract and return gender coefficient
gender_coefficient <- coef(linear_model)[2]
return(gender_coefficient)
}