Jak se doba zpracování mění v závislosti na velikosti dat?
Pokud zpracováváš všechny prvky dvou datových sad a jedna z nich je větší, bude její zpracování trvat déle. Je ale důležité si uvědomit, že doba zpracování nemusí být přímo úměrná velikosti dat. Jinými slovy – pokud je jedna datová sada dvakrát větší než druhá, neznamená to automaticky, že její zpracování bude trvat dvakrát déle. Může to být 1,5krát déle, ale klidně i čtyřikrát déle. Záleží na tom, jaké operace se při zpracování použijí.
V tomto cvičení využiješ balíček microbenchmark, který byl představen v kurzu Writing Efficient R Code.
Poznámka: Čísla jsou zadána ve vědecké notaci $$1e5 = 1 * 10^5 = 100,000$$
Toto cvičení je součástí kurzu
Škálovatelné zpracování dat v R
Pokyny k cvičení
- Načti balíček
microbenchmark. - Pomocí funkce
microbenchmark()porovnej dobu řazení náhodných vektorů. - Zavolej
plot()na objektmb.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load the microbenchmark package
___
# Compare the timings for sorting different sizes of vector
mb <- ___(
# Sort a random normal vector length 1e5
"1e5" = sort(rnorm(1e5)),
# Sort a random normal vector length 2.5e5
"2.5e5" = sort(rnorm(2.5e5)),
# Sort a random normal vector length 5e5
"5e5" = sort(rnorm(5e5)),
"7.5e5" = sort(rnorm(7.5e5)),
"1e6" = sort(rnorm(1e6)),
times = 10
)
# Plot the resulting benchmark object
___(mb)