Imputering med slumpskogar
En maskininlärningsbaserad metod för imputering kan vara både mer träffsäker och enklare att implementera jämfört med traditionella statistiska modeller. För det första behöver du inte ange relationer mellan variabler. Dessutom kan maskininlärningsmodeller som slumpskogar (random forests) identifiera komplexa, icke-linjära samband och utnyttja dem för att förutsäga saknade värden.
I den här övningen får du bekanta dig med paketet missForest, som bygger en separat slumpskog för att förutsäga saknade värden för varje variabel, en i taget. Du anropar imputeringsfunktionen på datamängden med biografiska filmer, biopics, som du har arbetat med tidigare i kursen – och extraherar sedan den ifyllda datan samt de uppskattade imputeringsfelen.
Dags att plantera lite slumpskogar!
Den här övningen är en del av kursen
Hantering av saknade värden med imputering i R
Övningsinstruktioner
- Ladda paketet
missForest. - Använd
missForest()för att imputera saknade värden ibiopics-datan och tilldela resultatet tillimp_res. - Extrahera den imputerade datamängden från
imp_res, tilldela den tillimp_data, och kontrollera att antalet saknade värden verkligen är noll. - Extrahera det uppskattade imputeringsfelet från
imp_res, tilldela det tillimp_err, och skriv ut det i konsolen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Load the missForest package
___
# Impute biopics data using missForest
imp_res <- ___(___)
# Extract imputed data and check for missing values
imp_data <- imp_res$___
print(___(___(___)))
# Extract and print imputation errors
imp_err <- imp_res$___
print(___)