Kom igångKom igång gratis

Imputering med slumpskogar

En maskininlärningsbaserad metod för imputering kan vara både mer träffsäker och enklare att implementera jämfört med traditionella statistiska modeller. För det första behöver du inte ange relationer mellan variabler. Dessutom kan maskininlärningsmodeller som slumpskogar (random forests) identifiera komplexa, icke-linjära samband och utnyttja dem för att förutsäga saknade värden.

I den här övningen får du bekanta dig med paketet missForest, som bygger en separat slumpskog för att förutsäga saknade värden för varje variabel, en i taget. Du anropar imputeringsfunktionen på datamängden med biografiska filmer, biopics, som du har arbetat med tidigare i kursen – och extraherar sedan den ifyllda datan samt de uppskattade imputeringsfelen.

Dags att plantera lite slumpskogar!

Den här övningen är en del av kursen

Hantering av saknade värden med imputering i R

Visa kurs

Övningsinstruktioner

  • Ladda paketet missForest.
  • Använd missForest() för att imputera saknade värden i biopics-datan och tilldela resultatet till imp_res.
  • Extrahera den imputerade datamängden från imp_res, tilldela den till imp_data, och kontrollera att antalet saknade värden verkligen är noll.
  • Extrahera det uppskattade imputeringsfelet från imp_res, tilldela det till imp_err, och skriv ut det i konsolen.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Load the missForest package
___

# Impute biopics data using missForest
imp_res <- ___(___)

# Extract imputed data and check for missing values
imp_data <- imp_res$___
print(___(___(___)))

# Extract and print imputation errors
imp_err <- imp_res$___
print(___)
Redigera och kör kod