Porovnání rychlosti načítání souborů CSV a RDS
Jednou z nejčastějších operací v datové analýze je načítání dat z CSV souborů. U velkých souborů to ale může být pomalé.
Šikovný trik spočívá v tom, že data načteš a uložíš jako binární soubor R (rds) pomocí funkce saveRDS().
Pro zpětné načtení souboru rds slouží funkce readRDS().
Poznámka: Formát rds je nativní formát R pro ukládání jednotlivých objektů, takže nevzniká žádná závislost na knihovnách třetích stran, které se mohou v budoucnu změnit.
Oba přístupy můžeš porovnat pomocí funkce system.time().
Tato funkce vrátí čas potřebný k vyhodnocení libovolného R výrazu. Například pro změření doby výpočtu druhé odmocniny čísel od jedné do deseti milionů bys napsal/a:
system.time(sqrt(1:1e7))
Toto cvičení je součástí kurzu
Efektivní kód v R
Pokyny k cvičení
Soubory "movies.csv" a "movies.rds" obsahují identické datové rámce s informacemi o 45 000 filmech.
- Pomocí funkce
system.time()změř, jak dlouho trvá načtení CSV souboru příkazemread.csv("movies.csv"). - Totéž zopakuj pro soubor
"movies.rds"s využitím funkcereadRDS().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# How long does it take to read movies from CSV?
system.time(read.csv(___))
# How long does it take to read movies from RDS?
___