Výkon při importu souborů
Máš k dispozici velkou sadu dat, kterou chceš načíst do Spark DataFrame. Chceš otestovat rozdíl v rychlosti importu tak, že soubor rozdělíš na více částí.
Máš dva typy souborů: departures_full.txt.gz a departures_xxx.txt.gz, kde xxx je 000 – 013. Stejný počet řádků je rovnoměrně rozdělen mezi jednotlivé soubory.
Toto cvičení je součástí kurzu
Cleaning Data with PySpark
Pokyny k cvičení
- Načti soubor
departures_full.txt.gza souborydepartures_xxx.txt.gzdo samostatných DataFramů. - Spusť počítání řádků na každém DataFrame a porovnej časy zpracování.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the full and split files into DataFrames
full_df = spark.read.csv('____')
split_df = ____(____)
# Print the count and run time for each DataFrame
start_time_a = time.time()
print("Total rows in full DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_a))
start_time_b = time.time()
print("Total rows in split DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_b))