ÎncepețiÎncepe gratuit

Imputare cu păduri aleatoare

O abordare bazată pe învățare automată pentru imputare poate fi atât mai precisă, cât și mai ușor de implementat față de modelele statistice tradiționale. În primul rând, nu trebuie să specifici relațiile dintre variabile. Mai mult, modele precum pădurile aleatoare pot descoperi relații complexe, neliniare, și le pot exploata pentru a prezice valorile lipsă.

În acest exercițiu, te vei familiariza cu pachetul missForest, care construiește câte o pădure aleatoare separată pentru a prezice valorile lipsă ale fiecărei variabile, pe rând. Vei apela funcția de imputare pe setul de date cu filme biografice, biopics, cu care ai lucrat anterior în curs, apoi vei extrage datele completate și erorile estimate de imputare.

Hai să plantăm niște păduri aleatoare!

Acest exercițiu face parte din cursul

Gestionarea datelor lipsă prin imputare în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Încarcă pachetul missForest.
  • Folosește missForest() pentru a imputa valorile lipsă din setul de date biopics; atribuie rezultatul variabilei imp_res.
  • Extrage setul de date imputat din imp_res, atribuie-l variabilei imp_data și verifică dacă numărul valorilor lipsă este într-adevăr zero.
  • Extrage eroarea estimată de imputare din imp_res, atribuie-o variabilei imp_err și afișeaz-o în consolă.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load the missForest package
___

# Impute biopics data using missForest
imp_res <- ___(___)

# Extract imputed data and check for missing values
imp_data <- imp_res$___
print(___(___(___)))

# Extract and print imputation errors
imp_err <- imp_res$___
print(___)
Editează și rulează codul