Imputare cu păduri aleatoare
O abordare bazată pe învățare automată pentru imputare poate fi atât mai precisă, cât și mai ușor de implementat față de modelele statistice tradiționale. În primul rând, nu trebuie să specifici relațiile dintre variabile. Mai mult, modele precum pădurile aleatoare pot descoperi relații complexe, neliniare, și le pot exploata pentru a prezice valorile lipsă.
În acest exercițiu, te vei familiariza cu pachetul missForest, care construiește câte o pădure aleatoare separată pentru a prezice valorile lipsă ale fiecărei variabile, pe rând. Vei apela funcția de imputare pe setul de date cu filme biografice, biopics, cu care ai lucrat anterior în curs, apoi vei extrage datele completate și erorile estimate de imputare.
Hai să plantăm niște păduri aleatoare!
Acest exercițiu face parte din cursul
Gestionarea datelor lipsă prin imputare în R
Instrucțiuni pentru exercițiu
- Încarcă pachetul
missForest. - Folosește
missForest()pentru a imputa valorile lipsă din setul de datebiopics; atribuie rezultatul variabileiimp_res. - Extrage setul de date imputat din
imp_res, atribuie-l variabileiimp_datași verifică dacă numărul valorilor lipsă este într-adevăr zero. - Extrage eroarea estimată de imputare din
imp_res, atribuie-o variabileiimp_errși afișeaz-o în consolă.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load the missForest package
___
# Impute biopics data using missForest
imp_res <- ___(___)
# Extract imputed data and check for missing values
imp_data <- imp_res$___
print(___(___(___)))
# Extract and print imputation errors
imp_err <- imp_res$___
print(___)