Začněte nyníZačněte zdarma

Jak se doba zpracování mění v závislosti na velikosti dat?

Pokud zpracováváš všechny prvky dvou datových sad a jedna z nich je větší, bude její zpracování trvat déle. Je ale důležité si uvědomit, že doba zpracování nemusí být přímo úměrná velikosti dat. Jinými slovy – pokud je jedna datová sada dvakrát větší než druhá, neznamená to automaticky, že její zpracování bude trvat dvakrát déle. Může to být 1,5krát déle, ale klidně i čtyřikrát déle. Záleží na tom, jaké operace se při zpracování použijí.

V tomto cvičení využiješ balíček microbenchmark, který byl představen v kurzu Writing Efficient R Code.

Poznámka: Čísla jsou zadána ve vědecké notaci $$1e5 = 1 * 10^5 = 100,000$$

Toto cvičení je součástí kurzu

Škálovatelné zpracování dat v R

Zobrazit kurz

Pokyny k cvičení

  • Načti balíček microbenchmark.
  • Pomocí funkce microbenchmark() porovnej dobu řazení náhodných vektorů.
  • Zavolej plot() na objekt mb.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load the microbenchmark package
___

# Compare the timings for sorting different sizes of vector
mb <- ___(
  # Sort a random normal vector length 1e5
  "1e5" = sort(rnorm(1e5)),
  # Sort a random normal vector length 2.5e5
  "2.5e5" = sort(rnorm(2.5e5)),
  # Sort a random normal vector length 5e5
  "5e5" = sort(rnorm(5e5)),
  "7.5e5" = sort(rnorm(7.5e5)),
  "1e6" = sort(rnorm(1e6)),
  times = 10
)

# Plot the resulting benchmark object
___(mb)
Upravit a spustit kód