Imputatie met logistic regression

Een populaire keuze om binaire variabelen te imputeren is logistic regression. Helaas is er geen functie zoals impute_lm() die dit doet. Daarom ga je zo'n functie zelf schrijven!

Noem de functie impute_logreg(). Het eerste argument is een data frame df, waarvan de missende waarden zijn geïnitialiseerd en dat alleen nog missende waarden bevat in de kolom die je gaat imputeren. Het tweede argument is een formula voor het logistic-regressionmodel.

De functie doet het volgende:

De locaties van missende waarden bewaren.
Het model bouwen.
Voorspellingen maken.
Missende waarden vervangen door voorspellingen.

Maak je geen zorgen over de regel die imp_var aanmaakt — dit is alleen een manier om de naam van de kolom die je gaat imputeren uit de formula te halen. Tijd voor wat functioneel programmeren!

Deze oefening maakt deel uit van de cursus

Omgaan met missende data met imputaties in R

Oefeninstructies

Maak een booleaanse mask voor waar df[imp_var] ontbreekt en wijs die toe aan missing_imp_var.
Fit een logistic-regressionmodel met de formula en data die de functie als argumenten krijgt, en zorg dat je de juiste family instelt zodat er een logistic regression wordt gefit (geef deze zonder aanhalingstekens door); wijs het model toe aan logreg_model.
Voorspel de respons met het model en wijs het toe aan preds; vergeet niet het juiste type voor de voorspelling in te stellen.
Gebruik preds samen met missing_imp_var om missende waarden te imputeren.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

impute_logreg <- function(df, formula) {
  # Extract name of response variable
  imp_var <- as.character(formula[2])
  # Save locations where the response is missing
  missing_imp_var <- ___
  # Fit logistic regression mode
  logreg_model <- ___(___, data = ___, family = ___)
  # Predict the response and convert it to 0s and 1s
  preds <- predict(___, type = ___)
  preds <- ifelse(preds >= 0.5, 1, 0)
  # Impute missing values with predictions
  df[missing_imp_var, imp_var] <-___[___]
  return(df)
}

Code bewerken en uitvoeren

Deze oefening maakt deel uit van de cursus

Omgaan met missende data met imputaties in R

SkillTag.level.advancedSkillTag.label

4.8+

Begin gratis met de cursus

In dit hoofdstuk ontdek je waarom missende data een risico kan zijn bij het analyseren van een gegevensset. Je maakt kennis met de drie mechanismen achter missende data en leert ze herkennen met statistische toetsen en visualisatietools.

Exercise 1: Ontbrekende data: wat kan er misgaan Exercise 2: Lineaire regressie met onvolledige gegevens Exercise 3: Regressie-uitvoer analyseren Exercise 4: Modellen vergelijken Exercise 5: Mechanismen achter ontbrekende data Exercise 6: Herkennen van mechanismen voor ontbrekende data Exercise 7: t-toets voor MAR: datavoorbereiding Exercise 8: t-toets voor MAR: interpretatie Exercise 9: Ontbrekende datap patronen visualiseren Exercise 10: Aggregatieplot Exercise 11: Ruggengraatafbeelding Exercise 12: Mozaïekdiagram

Leer de taxonomie van imputatiemethoden kennen en drie donorgebaseerde technieken: gemiddelde-, hot-deck- en k-Nearest-Neighbors-imputatie. Je kijkt onder de motorkap om te zien hoe deze methoden werken, voordat je ze toepast op een echte gegevensset met tropisch weer. Onderweg leer je ook handige trucs om ze nog beter te laten werken voor jouw problemen.

Exercise 1: Gemiddelde-imputatie Exercise 2: De gevaren van mean-imputatie ruiken Exercise 3: Gemiddelde-imputatie voor de temperatuur Exercise 4: De imputatiekwaliteit beoordelen met een margeplot Exercise 5: Hot-deck-imputatie Exercise 6: Standaard hot-deck Exercise 7: Hot-deck tips & tricks I: imputeren binnen domeinen Exercise 8: Hot-deck tips & tricks II: sorteren op gecorreleerde variabelen Exercise 9: k-Nearest-Neighbors-imputatie Exercise 10: Het aantal buren kiezen Exercise 11: kNN tips & tricks I: donoren wegen Exercise 12: kNN tips & tricks II: variabelen sorteren

Tijd om statistische en Machine Learning-modellen, zoals lineaire regressie, logistische regressie en random forests, te gebruiken om missende data te imputeren. In dit hoofdstuk kijk je hoe de modellen hun voorspellingen maken en gebruik je die kennis om de geïmputeerde waarden te trekken uit conditionele verdelingen. Dat is belangrijk, omdat je imputaties zo gevarieerder en plausibeler worden en meer lijken op de echte data.

Exercise 1: Modelgebaseerde imputatiemethode Exercise 2: Imputatie met lineaire regressie Exercise 3: Missende waarden initialiseren en over variabelen itereren Exercise 4: Convergentie detecteren Exercise 5: Variatie in data repliceren Exercise 6: Imputatie met logistic regression

Huidige oefening

Exercise 7: Trekken uit een conditionele verdeling Exercise 8: Modelgebaseerde imputatie met meerdere variabeletype Exercise 9: Boomgebaseerde imputatie Exercise 10: Imputeren met random forests Exercise 11: Variabelegewijze imputatiefouten Exercise 12: Afweging tussen snelheid en nauwkeurigheid

Geïmputeerde waarden staan niet in steen gebeiteld. Het zijn schattingen, en schattingen brengen onzekerheid met zich mee. In dit laatste hoofdstuk ontdek je hoe bootstrapping en gekoppelde vergelijkingen met het pakket mice kunnen worden gebruikt om onzekerheid door imputatie op te nemen in je modellen en analyses, zodat ze betrouwbaarder en robuuster worden.

Exercise 1: Meervoudige imputatie via bootstrapping Exercise 2: Imputatie en modelleren verpakken in een functie Exercise 3: De bootstrap uitvoeren Exercise 4: Bootstrap-confidence-intervallen Exercise 5: Meervoudige imputatie met chained equations Exercise 6: De mice-flow: mice - with - pool Exercise 7: Standaardmodellen kiezen Exercise 8: Een predictormatrix gebruiken Exercise 9: Alles samenbrengen Exercise 10: Analyseren van patronen in missende data Exercise 11: Imputeren en resultaten inspecteren Exercise 12: Inferentie met geïmputeerde data Exercise 13: Slotopmerkingen