Avvägning mellan hastighet och noggrannhet
I det senaste videoavsnittet såg du att det finns två parametrar du kan justera för att påverka prestandan hos random forests:
- Antal beslutsträd i varje skog.
- Antal variabler som används för uppdelning inom beslutsträden.
Att öka dessa värden kan förbättra noggrannheten hos imputeringsmodellen, men det kräver också mer körtid. I den här övningen utforskar du detta själv genom att anpassa missForest() till datamängden biopics två gånger med olika inställningar. Följ instruktionerna och lägg märke till de fel som skrivs ut samt hur lång tid koden tar att köra.
Den här övningen är en del av kursen
Hantering av saknade värden med imputering i R
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Set number of trees to 5 and number of variables used for splitting to 2
imp_res <- missForest(biopics, ___ = ___, ___ = ___)
# Print the resulting imputation errors
print(___)